거대 언어 모델의 매개변수를 늘리는 경쟁이 한계에 부딪혔습니다. 최근 연구진은 뇌 체급을 키우는 대신 일하는 환경을 개선하는 방안을 제시했습니다. 연구진이 20B 규모의 구형 모델로 최신 프론티어 모델의 검색 성능을 앞지른 비결을 살폈습니다.

지능과 장부 정리의 분리

LLM이 복잡한 검색 작업을 수행할 때 병목은 기억력과 토큰 관리에서 발생합니다. 기존 에이전트는 대화가 20-30 턴을 넘어가면 이전 맥락을 기억하고 중복을 걸러내는 단순 반복 작업에 성능을 낭비합니다. Harness-1은 이 과정을 시스템 환경으로 오프로딩했습니다. 모델에는 검색과 원문 읽기, 큐레이션을 제어하는 5가지 도구만 쥐어줍니다.

상태 저장 하네스가 중복 문서를 제거하고 텍스트를 압축하며 컨텍스트를 유지합니다. 모델은 의사결정에만 집중합니다. 효율이 극대화됩니다. 복잡한 연산 장부를 머릿속에서 지우자 판단 속도가 빨라졌습니다.

영리한 보상으로 다듬은 사냥 본능

도구가 훌륭해도 올바른 행동 양식을 학습하지 못하면 무용지물입니다. 연구진은 금융 보고서 분석 환경에서 강화학습을 진행하며 두 가지 장치를 심었습니다. 단순 검색 API만 반복 호출하면 벌점을 주는 툴 다양성 보상을 적용했습니다. 정답 후보를 찾고도 최종 보관함에 담지 않으면 감점을 주는 페널티도 설계했습니다.

정보 탐색과 선별을 자연스럽게 연결하는 훈련법입니다. 모델은 집요한 사냥꾼으로 변했습니다. 학습은 성공했습니다. 툴을 골고루 섞어 쓰며 예산을 인지하는 감각도 함께 자랐습니다.

체급을 뛰어넘는 전이 능력

체계적인 환경에서 훈련한 20B 모델은 프론티어 모델의 성능을 넘어섭니다. 이 모델은 검색 벤치마크에서 평균 재현율 73.0%를 기록했습니다. GPT-5.4의 재현율 70.9%와 Sonnet-4.6의 재현율 68.8%를 앞지르는 수치입니다. 체급 차이가 무색합니다.

금융 데이터로만 학습했음에도 특허나 일반 웹 등 낯선 영역에서 재현율이 17점 상승했습니다. 특정 지식을 단순히 외우지 않고 정보를 탐색하는 방법론을 체득한 결과입니다. 구형 모델을 튜닝 키트로 학습시켜 스포츠카를 이겨낸 셈입니다. 성능 격차는 환경 설계에서 벌어집니다.

AI의 경쟁력은 모델 크기가 아닌 정교한 시스템 설계가 결정합니다. 가벼운 오픈소스 모델로도 프라이빗 검색 엔진을 구축할 길이 열렸습니다.

요약

  • 대화가 길어질 때 발생하는 컨텍스트 관리 부담을 외부 시스템(하네스)으로 오프로딩하여 LLM의 인지 자원을 보존합니다.
  • 단순 검색 반복을 방지하는 다양성 보상과 정보 수집 누락을 방지하는 패널티를 결합한 강화학습이 에이전트의 탐색 효율을 극대화합니다.
  • 정교한 환경 설계와 동작 학습을 거친 소형 모델은 특정 도메인에 국한되지 않고 범용적인 정보 탐색 전이 능력을 보여줍니다.