터미널에서 LLM이 코드를 짜는 시대가 열렸습니다. 이제는 단순히 한 번 짜주는 것을 넘어 목표 지표를 달성할 때까지 스스로 코드를 고치고 테스트하는 도구가 필요합니다. Claude Code 에서 구동하는 스킬 패키지, Claude Autoresearch 가 이 작업을 수행합니다.

Karpathy의 아이디어를 확장한 8단계 루프

Claude Autoresearch 는 사용자가 지정한 단일 지표를 개선하기 위해 기계적 검증과 자동 롤백을 무한히 반복합니다. ML 모델을 밤새 학습시키며 성능을 올리던 개발 방식에서 착안했습니다. 코드 수정, 검증, 반영 여부 판단으로 이어지는 8단계 루프를 자동으로 수행합니다. 단순합니다.

한 번에 딱 한 가지만 바꿉니다. 지표가 나빠지면 git으로 즉시 이전 상태로 되돌립니다. 결과 기록은 TSV 파일에 한 줄씩 남깁니다. 확실합니다.

목적에 맞춰 실행하는 6가지 슬래시 명령

단순 반복 외에 보안 감사, 디버깅, 출시 가이드 등 특정 목적에 특화한 명령들을 슬래시 형태로 제공합니다. /autoresearch:plan 명령으로 목표와 검증 방식을 먼저 설계합니다. 보안 감사를 처리하는 /autoresearch:security 도 유용합니다.

취약점을 찾고 자동으로 고쳐줍니다. /autoresearch:debug 는 가설을 세워 오류를 추적합니다. 다른 기능이 깨지지 않도록 막아주는 Guard 옵션도 지원합니다. 꽤 꼼꼼합니다.

설치와 실제 커버리지 개선 적용

Claude Code 플러그인 설정 파일에 저장소 경로를 등록하면 즉시 도구를 사용합니다. 로컬 환경에 직접 파일을 복사해서 스킬을 활성화하는 방법도 가능합니다. 테스트 커버리지를 72-90% 범위로 올리는 작업에 바로 써봤습니다.

명령 한 줄이면 루프가 시작됩니다. 실패한 커밋은 버리고 성공한 기록만 git 역사에 남습니다. 유용합니다.

지루한 수정과 테스트 루프를 AI에게 완전히 맡깁니다. 개발자는 터미널을 켜고 루프를 실행하기만 하면 됩니다.

요약

  • 단일 지표(Metric)를 기준으로 코드 수정과 검증, 롤백을 자동 반복하는 8단계 루프 설계
  • 보안 감사, 계획 수립, 디버깅, 출시 등 특정 작업에 특화한 6가지 슬래시 명령 지원
  • Guard 옵션으로 목표 지표 개선 시 다른 기능이 깨지지 않도록 안전장치 마련