RAG 시스템을 구축할 때 가장 먼저 마주하는 난관은 문서를 자르는 작업입니다. 아무리 좋은 LLM을 써도 청크가 엉망으로 쪼개지면 검색 단계부터 오동작합니다. 해결책이 필요합니다.

청킹 품질을 평가하는 5가지 내재적 지표

문서마다 물리적 구조와 담고 있는 맥락이 다르므로 하나의 청킹 규칙을 고집하면 안 됩니다. 이 연구는 정답 없이 청크 일관성을 평가하는 내재적 지표(intrinsic metrics) 를 제안합니다. 중요합니다. 대명사 연결성을 추적하는 참조 완결성(RC)과 표나 그림 같은 레이아웃을 지키는 블록 무결성(BI)이 핵심 지표로 꼽힙니다.

청크 내부의 의미적 유사도를 측정하는 응집성(ICC)과 주변 맥락과의 관계를 보는 일관성(DCC)도 활용합니다. 목표 토큰 크기 범위를 맞추는 크기 준수(SC) 지표도 봅니다. 차이가 큽니다. 이 지표들로 점수를 매겨 문서별 최적 알고리즘을 고릅니다.

동적 정규식과 이중 패스 병합

선택지를 넓히기 위해 연구진은 새로운 청킹 기법 두 가지를 설계했습니다. 먼저 LLM 정규식 분할기(Regex Splitter) 는 LLM으로 문서 구조를 분석해 정규식 패턴을 뽑아냅니다. 유용합니다. 매 청크 경계마다 LLM을 호출하지 않고 최초 1회만 정규식을 뽑아 적용하므로 연산 비용이 적습니다.

다른 하나인 이중 패스 재귀 분할기(Split-then-Merge) 는 작게 쪼개진 파편들을 다시 합치는 기법입니다. 기준 크기를 지키면서도 맥락 파괴를 막습니다. 눈에 띕니다. 여기에 최대 크기를 초과한 청크를 재분할하고 최소 크기 미달 청크를 병합하는 후처리를 더해 완성도를 높였습니다.

문서 파싱 단계에서는 다양한 PDF 백엔드를 지원합니다. 오픈소스 도구인 Docling을 기본으로 사용하며 가벼운 PyMuPDF나 클라우드 기반 API를 선택합니다. 유연합니다. 파서가 추출한 구조 정보가 고스란히 청킹 엔진의 입력값으로 들어갑니다.

정확도를 끌어올리는 청킹의 힘

성능 평가는 실제 RAG 벤치마크 환경에서 진행했습니다. 프레임워크를 적용하자 기존 단일 방식 대비 RAG 답변 정확도가 62-64%에서 72% 부근으로 상승했습니다. 확실한 개선입니다. 모델이나 프롬프트를 전혀 수정하지 않고 청킹 전략 하나만 동적으로 바꿨을 뿐인데 정답률이 크게 올랐습니다.

성공적으로 답변한 질문 개수 역시 30% 이상 늘어났습니다. 구조가 답입니다.

요약

  • 일률적인 청킹 전략 대신 문서의 구조와 맥락을 반영한 동적 청킹이 RAG 성능을 결정합니다.
  • 정답 라벨 없이 청크 자체의 품질을 평가하는 5가지 내재적 지표로 평가 자동화를 구현했습니다.
  • LLM 정규식 분할기와 후처리 병합 기법으로 연산 비용을 줄이면서 청크 크기 규격을 보존합니다.