Databricks AI Search와 한국어 처리

Databricks AI Search는 성능이 뛰어나지만 한국어 처리에 제약이 있습니다. 많은 엔지니어가 사용하는 Nori를 지원하지 않아서입니다. 한국어는 조사와 어미가 발달한 교착어라 단순 공백 기반 토큰화로는 검색 재현율(recall)을 확보하기 어렵습니다.

‘수하물’과 ‘수하물의’가 서로 다른 토큰으로 처리되면 검색 품질이 떨어집니다. 색인 전 단계에서 형태소 분석을 거쳐 토큰을 정규화해야 합니다. 토큰 정규화가 곧 검색 성능입니다. Nori의 대안으로 Kiwi를 선택한 이유입니다.

Kiwi를 활용한 하이브리드 검색

Kiwi는 사용자 사전은 지원하지만 동의어 사전 기능이 부족합니다. 그래서 동의어 확장을 구현해 파이프라인에 통합했습니다. BM25와 dense 검색을 결합한 하이브리드 전략에서 Kiwi가 정교한 토큰을 제공해 검색 정확도가 올랐습니다.

사전 관리와 성능 검증이 검색 시스템의 완성도를 결정합니다. IATA 공항 코드처럼 도메인 특화 사전은 자동 생성 프로세스를 구축해야 운영 효율이 높습니다. 수동 관리는 비용이 크므로 자동화를 권장합니다.

성능 검증

검색 품질을 높이려면 정량적 지표가 필요합니다. Kiwi와 Nori의 분석 결과를 비교하며 서비스에 적합한 토큰화 방식을 확정했습니다. 품사 태깅 정확도와 처리 속도를 모두 고려해야 합니다. 데이터로 확인해야 합니다.

한국어 RAG 환경에서 검색 품질을 고민한다면 Kiwi를 활용해 보길 바랍니다. 정교한 전처리가 시스템의 신뢰도를 결정합니다.

요약

  • Databricks AI Search는 Nori를 지원하지 않아 별도의 한국어 형태소 분석기 도입이 필수적입니다.
  • 교착어 특성상 공백 토큰화보다는 Kiwi와 같은 형태소 분석기를 통한 토큰 정규화가 BM25 recall에 직결됩니다.
  • 동의어 사전이 없는 Kiwi의 단점은 별도 확장 모듈을 구현하여 보완하고 도메인 사전은 자동 생성 파이프라인으로 관리해야 합니다.