RAG 성능을 올리려고 청크 크기를 조절하고 리랭커를 붙여봐도 복잡한 다단계 질문 앞에서는 막히기 일쑤입니다. 구글 리서치는 이 문제를 해결하고자 여러 에이전트가 협업하는 Agentic RAG 프레임워크를 제안했습니다. 구조가 독특합니다.

정보 충족 여부를 판단하는 에이전트

이 시스템은 검색한 정보가 충분한지 에이전트가 스스로 검증하고 부족하면 검색을 반복합니다. 기존 시스템은 검색 결과가 부실하면 엉뚱한 답을 지어내거나 쉽게 포기했습니다. 구글은 Sufficient Context Agent 를 도입해 이 문제를 풀었습니다. 검사관 역할입니다.

오케스트레이터가 복잡한 요청을 분석해 하위 에이전트들에게 업무를 나눕니다. 플래너가 검색 경로를 설계하면 쿼리 리라이터가 모호한 질문을 명확한 검색어로 바꿉니다. 분담이 확실합니다. 팬아웃 에이전트가 여러 소스에서 정보를 동시에 수집해 효율을 높입니다.

수집한 텍스트 조각과 답변 초안을 대조하며 빠진 정보가 있는지 살핍니다. 알레르기 반응 여부처럼 누락된 항목을 발견하면 구체적인 피드백을 보냅니다. 피드백을 받은 리라이터가 새로운 키워드로 재검색을 시작합니다. 집요합니다.

다단계 추론과 교차 코퍼스 성능

구글은 여러 단계를 거쳐야 답을 내는 FramesQA 데이터셋으로 시스템을 검증해 성능 향상을 입증했습니다. 시청률이 높은 두 예능의 방영 시간 차이를 묻는 복잡한 질문에서도 에이전트들은 각자 정보를 수집하고 계산을 마쳤습니다. 단일 코퍼스 기준 기존 RAG 와 비교해 정확도가 최대 34% 올랐습니다. 차이가 큽니다.

여러 부서가 관리하는 다른 데이터베이스를 섞어놓은 교차 코퍼스 환경에서도 우수한 성능을 보였습니다. 플래너 에이전트가 여러 후보 중에서 올바른 데이터베이스를 선택해 쿼리를 보냅니다. 시스템은 질문의 90-95% 구간에 근접한 90.1%의 정확도를 기록했습니다. 결과가 좋습니다.

감사 가능한 시스템 설계

에이전트들이 남기는 피드백 로그는 답변의 신뢰성을 검증하는 강력한 근거가 됩니다. 기업 환경에서는 인공지능이 왜 이런 판단을 내렸는지 설명하는 능력이 중요합니다. Sufficient Context Agent 가 남긴 판단 이유와 검색 이력은 훌륭한 감사 추적선 역할을 합니다. 추적이 쉽습니다.

검색을 멈추는 시점을 스스로 결정하므로 불필요한 API 호출을 줄여 비용을 아낍니다. 실무적입니다. 단순히 정확도 숫자를 올리는 수준을 넘어 실제 비즈니스 환경에 적용 가능한 신뢰성을 확보했습니다.

검색을 단순한 조회에서 검증과 협업의 영역으로 확장했습니다. 신선합니다.

요약

  • Sufficient Context Agent는 답변 생성 전 검색된 정보가 충분한지 스스로 검증하여 환각 현상을 방지합니다.
  • FramesQA 벤치마크 평가 결과 교차 코퍼스 환경에서도 90.1%의 높은 정확도를 기록하며 실무 적용 가능성을 입증했습니다.
  • 에이전트가 남기는 피드백과 판단 이유 로그로 AI 답변의 감사와 추적 가능성을 크게 향상시켰습니다.