OpenAI의 가격 인하 소식으로 모델 전환 검토가 시작됐습니다. 단가를 이유로 무작정 갈아탔다가 상담 품질을 잃으면 고객이 떠납니다. 채널톡은 공개 리더보드 대신 실제 에이전트 엔진에서 작동하는 전용 벤치마크를 구축해 검증했습니다.

공개 리더보드가 말해주지 않는 실전 지표

공개 벤치마크 점수만으로는 프로덕션 적용 여부를 판단하기 어렵습니다. 글로벌 상담 에이전트 ALF는 고객과 멀티턴 대화를 나누며 지식 문서를 확인하고 툴을 호출합니다. 수학이나 코딩 성능이 상담 품질을 보장하지 않습니다. 차이가 큽니다.

τ²-bench 최상위인 GLM-5.2도 실제 엔진에 얹자 한계가 나타났습니다. reasoning effort를 높이면 통과율은 오르지만 평균 응답 시간이 17.1초까지 늘어납니다. 실시간 채팅 상담에는 어울리지 않는 속도입니다. 공개 리더보드에 없는 모델을 직접 발굴해 테스트해야 했던 이유입니다.

5가지 능력과 케이스 세트 중심의 검증

자체 벤치마크는 단순 지능이 아닌 에이전트 필수 역량을 평가합니다. 정보 노출, 단계별 동작, 일관성, 지시 준수, 액션 충실성의 5가지 지표를 pass^k 조건으로 다회 측정합니다. 내부 실행 과정이 노출되는 결함이 확인된 모델은 곧바로 후보에서 걸러냈습니다. 엄격한 기준입니다.

전체 평가에는 두 가지 케이스 세트를 함께 활용합니다. 상담 대표 케이스는 해결률을 측정하는 기준이 되며, 회귀 방지 케이스는 과거 장애의 재발 여부를 감시합니다. 기존 메인 모델인 Claude Sonnet 4.6 은 회귀 방지 점수가 높은 편이라 교체 문턱이 높았습니다.

최종 선택과 점진적 배포 전략

최종 선택은 GPT-5.6 Luna 의 high effort 조합이었습니다. 기존 모델 대비 대표 케이스 통과율은 40.4%에서 51.8%로 상승하고 회귀 방지율은 71.4%로 유지됐습니다. 토큰 단가는 기존의 13분의 1 수준으로 줄어들었습니다. 확실한 우위입니다.

모델 확정 후에도 안전한 점진적 배포 전략을 적용합니다. 상담 품질 영향이 적은 Agentic RAG 영역부터 순차 전환한 뒤, 테스트베드 채널 검증과 A/B 테스트를 진행합니다. 과금 구조 변화와 ZDR 계약 조건까지 꼼꼼히 확인하며 적용 범위를 늘려가고 있습니다.

실무 환경을 완벽히 재현한 자체 벤치마크가 올바른 모델 교체를 이끌었습니다. 프로덕션 경쟁력은 서비스 워크로드를 얼마나 정밀하게 측정하느냐에 달려 있습니다.

요약

  • 공개 벤치마크 순위나 지능 점수는 멀티턴 상담 에이전트의 실제 프로덕션 성능을 보장하지 못하며, 자체 엔진 기반의 프록시 벤치마크가 필수적입니다.
  • reasoning effort 설정에 따라 통과율과 응답 속도의 트레이드오프가 크게 발생하므로 메인 응답과 Agentic RAG 등 용도별로 effort 수준을 분리 적용해야 합니다.
  • 모델 교체 시 품질 평가뿐만 아니라 Provider별 API 할인 조건, ZDR 데이터 보호 계약, 272K 컨텍스트 과금 구조, 장애 대비 fallback 체계까지 고려한 점진적 배포가 요구됩니다.