프롬프트를 정교하게 다듬는 것만으로는 부족합니다. 이제 관건은 에이전트가 동작하는 시스템 전체를 설계하는 일입니다. 도구를 호출하고, 결과를 검증하고, 실패하면 되돌아가는 폐루프(closed loop) 를 만드는 흐름 — 이것이 루프 엔지니어링(loop engineering) 입니다.

큐레이터 노트

LangChain의 “어떻게 루프를 닫을까(The Art of Loop Engineering)” 아티클에서 가장 눈에 띈 대목은 마지막 단계인 힐 클라이밍 루프였습니다. 작업이 끝난 뒤 스스로 회고하며 루프를 닫는다는 발상이죠.

저는 여기에 교육학의 백워드 설계(backward design) 를 얹어, 실행 전에 먼저 루브릭을 정의하는 방법을 여러 방식으로 시도하고 있습니다. 아직 루프를 닫는 마지막 판단에는 사람의 취향이 필요하다고 보지만, 모델이 더 좋아지면 LLM judge로 대부분 해결될지도 모르겠습니다.

루프의 네 단계 — LangChain의 루프 아키텍처

LangChain은 에이전트를 감싸는 루프를 네 단계로 정리합니다. 아래로 갈수록 자동화 수준이 높아집니다.

  1. 에이전트 루프 — 모델이 도구를 반복 호출하며 작업을 끝낼 때까지 돌아가는 기본 골격입니다. create_agent 가 이 뼈대를 제공합니다.
  2. 검증 루프 — 그레이더(grader)가 출력물을 루브릭에 맞춰 평가하고 피드백을 돌려줍니다. 사람이 일일이 확인하지 않아도 품질을 일정하게 유지합니다.
  3. 이벤트 기반 루프 — 크론·웹훅 같은 트리거로 에이전트를 더 큰 시스템에 연결합니다. 수동 도구가 아니라 상시 동작하는 구성요소로 바뀝니다.
  4. 힐 클라이밍 루프 — 실행 흔적(trace)을 분석해 프롬프트·도구·그레이더를 스스로 조정하며 개선 자체를 자동화합니다.

핵심은 모델 그 자체가 아니라 에이전트를 감싼 루프 에 있습니다. 사람의 판단과 토큰 자본을 결합한 학습 루프를 갖춘 조직이 복제하기 어려운 경쟁력을 얻습니다.

루프를 설계·검증하는 도구

loop-engineering 저장소는 이런 루프를 설계하고 검증하는 실용적인 CLI를 제공합니다. 로컬에서 에이전트를 구동할 때 흔한 무한 루프나 자원 낭비를 막는 데 유용합니다.

  • loop-init — 상태·예산 파일을 구성하고 준비 점수를 확인해 첫 루프 실행을 돕습니다.
  • loop-cost — 실행 전에 토큰 소비량을 미리 예측합니다.
  • loop-sync — 상태 간의 차이를 감지해 운영 안정성을 지킵니다.

예산 범위 안에서 에이전트가 안전하게 돌도록 잡아 주는 안전장치인 셈입니다.

루브릭 우선 평가 — gnomon

에이전트가 내놓은 결과물의 신뢰성을 검증하려면 기준이 먼저입니다. 오픈소스 도구인 gnomon 은 코드를 짜기 전에 평가 루브릭부터 정의하자고 제안합니다.

  • gnomon rubric new 로 평가 템플릿을 만들고 비율을 검증한 뒤 에이전트를 실행합니다.
  • 자가 채점 편향을 막기 위해 정량 평가 30% 이상, LLM 평가 70% 이하 로 비율을 제한합니다.

기계적인 평가에만 기대지 않고 객관적인 지표를 섞어 신뢰도를 확보하는 장치입니다. 검증 루프를 통과할 때까지 에이전트가 결과물을 스스로 고쳐 나가도록 유도합니다.

백워드 설계와 회고로 루프 닫기

작업을 역으로 거슬러 올라가며 리플레이하는 힐 클라이밍 루프는 에이전트의 완성도를 끌어올리는 핵심 기법입니다.

  • OpenClaw 나 Claude Code 에서 작업을 마친 뒤 회고를 지시하면, 에이전트가 메모리 흔적을 추적합니다.
  • ouroboros 처럼 로컬 DB(SQLite)를 쓰는 도구는 세션이 로컬에 남아 디버깅이 쉽습니다.
  • 스스로 회고·개선하도록 루프를 짰다면, 로컬 git에 작업 기록을 남겨 안전한 이전 상태로 돌아갈 수 있게 만듭니다. 목표가 바뀌거나 비용을 줄여야 할 때 든든한 기반이 됩니다.

완전한 자동화에 앞서, 사람이 선호하는 기준을 루브릭으로 먼저 정의하는 백워드 설계 가 현실적입니다. 민감한 동작을 승인하거나 최종 결과·설정 변경을 검토하는 등, 모든 단계에 사람이 개입하는 지점(HITL) 을 남겨 두는 편이 안전합니다. 결과물의 품질을 가르는 마지막 단계에는 여전히 사람의 안목과 취향이 필요하고, 그 취향은 작은 습관에서 만들어집니다.

요약

  • 단순 프롬프트 작성을 넘어, 에이전트가 스스로 오동작을 검증하고 실패 시 되돌아가는 다중 루프 시스템 설계가 핵심입니다.
  • LangChain은 루프를 에이전트 → 검증 → 이벤트 기반 → 힐 클라이밍의 네 단계로 정리하며, 위 단계로 갈수록 개선이 자동화됩니다.
  • 자가 채점 편향을 막으려면 정량·LLM 평가 비율을 제한한 루브릭 우선 평가가 유효하며, 회고 지시와 로컬 세션 관리로 힐 클라이밍 루프를 완성할 수 있습니다.