최근 AI 모델과 코딩 에이전트를 보조하는 하네스 시스템이 쏟아져 나옵니다. 개발자들은 이러한 부수적인 도구가 실제로 더 좋은 소프트웨어를 만드는 데 기여하는지 의문을 품습니다. 이 의문을 풀기 위해 실제 개발 환경을 모사하여 에이전트를 평가하는 CopyEval 벤치마크가 등장했습니다.

에이전트의 한계를 시험하는 세 가지 기준

CopyEval 벤치마크는 문제 해결력, 사용자 의도 반영, 비용 효율성이라는 세 가지 축으로 에이전트 하네스를 평가합니다. 첫 단계는 자연어 요구사항을 입력하고 숨겨진 테스트케이스 통과 여부를 확인하는 방식입니다. 여기에 고등 에이전트가 피드백을 주어 코드를 개선하는 루프 검증을 결합하는 점이 독특합니다.

단순히 정답률만 보지 않고 소모한 토큰과 비용을 함께 계산하며 비용 효율성도 꼼꼼히 따집니다. 테스트에는 bare-agent 와 superpowers 나 opencode, oh-my-openagent, headroom 등 다섯 가지 시스템을 사용했습니다. 데이터셋은 2048 이나 hugo, wordle 같은 오픈소스에서 요구사항을 추출해 구성했습니다.

실험 결과로 밝혀진 하네스의 실상

하네스 시스템이 모델 자체의 체급 차이를 극복하게 만들어 주지는 못하는 것으로 드러났습니다. 문제 해결 능력은 결국 어떤 LLM을 사용하느냐에 따라 결정적인 차이를 보였습니다. 하네스는 동일 모델 내에서 미세한 성능 향상을 이끌어낼 뿐이어서 그 효과는 미미합니다.

비용 관점에서도 예상과 다른 결과를 관찰했습니다. 성능이 뛰어난 Sonnet 모델은 Haiku보다 토큰을 적게 소모하지만 단가가 높아 전체 비용이 더 많이 들어 낭비가 심합니다. oh-my-openagent 의 경우 성능은 평이하면서 토큰 소모량만 비정상적으로 많았습니다.

토큰 절감을 내세운 headroom 도 실제 개발 상황에서는 광고하는 수준만큼의 비용 이득을 주지 못했습니다. 성능 저하는 없었지만 비용 절감 효과가 작아 실제 광고와의 차이가 큽니다.

현실적인 벤치마크 설계의 제약과 과제

실제 에이전트를 평가하는 과정에서는 환경적인 제약과 측정 노이즈가 강하게 작용합니다. UI 디자인을 평가할 때 픽셀 단위 오차값만 제공하므로 에이전트가 구체적인 수정 방향을 잡지 못하고 방황합니다. 샌드박스 환경의 네트워크 차단이나 고정된 툴체인 문제로 빌드가 실패하기도 하는 등 여러 한계가 있습니다.

동일한 코드 빌드임에도 측정 타이밍에 따라 점수가 요동치는 노이즈도 존재합니다. 이러한 제약 속에서도 자체 에이전트 루프를 구축하려는 조직에게 CopyEval은 훌륭한 기준점을 제시합니다. 내부 시스템의 실질적인 성능과 비용을 저울질하는 데 매우 유용합니다.

이제는 막연한 기대감보다 객관적인 지표로 에이전트의 효율을 측정해야 합니다.

요약

  • 코딩 에이전트의 문제 해결 능력은 하네스 시스템보다 적용된 LLM의 자체 성능에 지배적인 영향을 받습니다.
  • 일부 에이전트 하네스는 해결 불가능한 태스크에서도 루프를 반복하며 비정상적인 토큰 낭비를 유발합니다.
  • 실제 개발을 모사한 벤치마크에서는 네트워크 차단이나 고정 툴체인 같은 샌드박스 환경 제약이 평가 노이즈로 작용합니다.