채널톡이 프로덕션 상담 에이전트 모델을 GPT-5.6 Luna로 교체한 이유

채널톡이 프로덕션 상담 에이전트 모델을 GPT-5.6 Luna로 교체한 이유

채널톡이 글로벌 상담 AI 에이전트의 메인 모델을 GPT-5.6 Luna로 전환한 과정을 정리합니다. 공개 리더보드 대신 자체 벤치마크를 구축해 품질과 속도, 비용을 함께 평가한 실제 프로덕션 검증 방식과 점진적 배포 절차를 살핍니다.

8월 27, 2026 · 2 분 · Junho Lee
코딩 에이전트 하네스의 실효성을 검증하는 CopyEval을 소개합니다

코딩 에이전트 하네스의 실효성을 검증하는 CopyEval을 소개합니다

AI 코딩 에이전트의 하네스와 루프 시스템이 실제로 소프트웨어 개발 효율을 높이는지 비용과 성능 관점에서 객관적으로 평가하는 CopyEval 벤치마크를 소개합니다.

7월 11, 2026 · 2 분 · Junho Lee
내 PC에 맞는 최적의 로컬 LLM을 찾는 방법

내 PC에 맞는 최적의 로컬 LLM을 찾는 방법

하드웨어 사양을 감지해 실측 벤치마크 기반으로 최적의 오픈소스 모델을 추천하는 whichllm 활용법을 살펴봅니다.

5월 18, 2026 · 1 분 · Junho Lee

8. 유통 샘플 30문항 80%, 4번의 PDCA

라우팅 설계를 붙인 뒤 30문항 벤치마크에서 NL2SQL EX(Execution Accuracy)를 66.67%에서 80%까지 올렸습니다. 4사이클 동안 무엇을 고쳤고 어떤 한계에 부딪혔는지 정리합니다.

4월 14, 2026 · 7 분 · Junho Lee