범용 코딩 에이전트 하네스가 늘어나는 상황에서 특정 소버린 모델에 맞춘 전용 하네스의 필요성이 커집니다. Upstage Solar Open 2 모델을 측정하고 최적화한 전용 하네스 Sol 은 성능과 비용 면에서 명확한 차이를 입증했습니다.

하네스 구조와 모델 측정의 필요성

소버린 모델의 성능을 끌어올리려면 추측 대신 모델의 동작 특성을 직접 측정해 상수로 고정해야 합니다. Sol 은 src/sol/model.py 파일에 수치화된 근거를 기록하며 주요 작동 특성을 반영했습니다. reasoning 과 content 가 max_tokens 예산을 공유하므로 출력 예산을 모델 최대치인 131,072 토큰으로 설정했습니다. 작은 예산 환경에서는 빈 응답이 반환되는 현상이 확인되었기 때문입니다.

도구 명세가 캐시 프리픽스에 포함되어 도구 하나만 변경되어도 캐시가 깨지는 현상을 방지하고자 프리픽스를 고정했습니다. 도구 호출과 응답 쌍이 누락되면 HTTP 400 에러가 발생하는 특성에 맞춰 압축 시 쌍 단위로만 잘라내도록 구현했습니다. 세부 파라미터는 temperature=0, top_p=1 로 고정하여 일관된 추론을 유지합니다.

범용 하네스와의 성능 및 비용 비교

동일한 모델과 과제로 실행을 비교했을 때 전용 하네스는 시간과 비용 면에서 우위를 보였습니다. 실행 비교 결과는 아래와 같습니다.

  1. 자체 제작 하네스 Sol : 2분 50초, $0.0167
  2. Claude Code : 3분 08초, $0.0216
  3. Codex : 3분 36초, $0.0178
  4. OpenCode : 3분 42초, $0.0241

Sol 은 캐시 히트율 93.97% 를 기록해 다른 하네스 대비 7-12%p 높은 효율을 달성했습니다. 한국어 토큰 밀도 또한 토큰당 1.85자로 영어 6.48자 대비 높은 효율을 보였습니다. 랜딩 페이지 제작 과정에서 한국어 문장의 줄바꿈이 자연스럽게 처리되는 동작도 확인되었습니다.

소버린 AI 하네스의 글로벌 흐름과 시사점

글로벌 AI 생태계에서도 자국어 모델과 전용 에이전트 하네스를 결합하는 시도가 이어집니다. 인도의 Sarvam 은 3단 에이전트 구조의 Sarvam Code 를 구축했고 프랑스 Mistral 도 Vibe for Code 하네스를 선보였습니다. 국내 소버린 모델의 경쟁력을 높이기 위해서는 고도화된 한국어 처리 능력과 NPU 기반 저렴한 추론 인프라가 함께 갖춰져야 합니다.

모델 특성에 맞춘 전용 하네스 설계는 소버린 AI 생태계 구축의 핵심 요소입니다. 맞춤형 최적화가 모델의 진짜 성능을 끌어냅니다.

요약

  • 모델의 동작 특성(Reasoning 예산, 캐시 프리픽스, 도구 호출 Pair)을 직접 측정해 상수로 고정하는 하네스 설계가 실행 시간과 비용을 크게 절감합니다.
  • Solar 전용 하네스 Sol은 동일 태스크에서 Claude Code, Codex, OpenCode 대비 2분 50초, $0.0167로 시간과 비용 모두 1위를 기록했습니다.
  • 프랑스 Mistral과 인도 Sarvam의 사례처럼 소버린 모델 보유국들은 전용 하네스 및 자국 인프라 구축을 통합 추진하는 흐름을 보이고 있습니다.