최근 GPT-5.6 Luna 의 토큰 단가가 80% 인하되었고 DeepSeek V4 Flash 도 성능이 대폭 상승했습니다. 모든 작업에 단일 고성능 모델인 Sol 을 사용하는 방식은 비효율적입니다. 메인 모델과 서브에이전트 모델의 역할을 분리하는 설정 변경이 필요한 시점입니다.

구독 할당량으로 시작하는 서브에이전트 설정

첫 단계로 기존 Codex 구독 할당량을 활용해 추가 비용 없이 luna_worker 라우팅을 구성합니다. ~/.codex/agents/luna-worker.toml 파일에서 모델을 gpt-5.6-luna 로 지정하고 model_reasoning_effort 값을 max 로 설정합니다. 서브에이전트의 구체적 작업 지침은 AGENTS.md 파일에 정의합니다. 이를 통해 독립된 파일 수정이나 조사 업무를 병렬로 위임하는 구조를 완성합니다.

구분설정 위치핵심 설정 값역할
작업 에이전트luna-worker.tomlmodel = "gpt-5.6-luna"조사 및 구현 작업을 수행합니다.
호출 규칙AGENTS.md“독립된 큰 작업은 병렬 위임”메인과 서브의 작업을 분리합니다.

메인 에이전트인 Sol 은 전체 시스템 설계와 최종 검토에만 집중하도록 구성합니다. 나머지 복잡한 구현이나 자료 조사는 luna_worker 가 나눠서 처리하여 역할 분담을 명확히 맞춥니다. 토큰 비용을 대폭 낮추면서도 결과물 품질을 안정적으로 유지합니다.

OpenRouter 및 외부 API 연결 옵션

사용량이 부족하거나 더 낮은 단가를 원한다면 외부 API 연결이 필요합니다. ~/.codex/config.toml 파일에 OpenRouter 프로바이더를 등록하면 하나의 엔드포인트로 여러 모델을 호출합니다. OpenRouter 의 GPT-5.6 Luna Max 또는 DeepSeek V4 Flash 0731 Max 모델을 서브에이전트로 붙여 가성비를 끌어올립니다. 대량 작업에서 최적의 캐시 단가를 원할 때는 DeepSeek 공식 API를 직접 연결하는 방법도 좋습니다.

상황에 맞춰 네 가지 옵션 중 하나를 선택합니다.

  1. Codex Luna worker 사용: 기존 구독 할당량을 활용하므로 추가 결제가 없습니다.
  2. OpenRouter Luna Max 사용: 성능과 비용 사이의 균형이 가장 우수합니다.
  3. OpenRouter DeepSeek V4 Flash 0731 Max 사용: 데이터 처리 조건을 직접 제어합니다.
  4. DeepSeek V4 Flash Max 사용: 대량 작업에 대한 토큰 비용이 가장 저렴합니다.

어떤 옵션을 선택하든 두 가지 원칙을 지켜야 합니다. 지정한 모델은 메인이 아닌 subagent 로만 활용해야 하며, 각 모델의 reasoning effort 설정은 반드시 max 로 고정해야 품질 저하를 막습니다.

라우터 프로바이더 선택 시 주의사항

단순 입력과 출력 토큰 가격만 보고 프로바이더를 결정하면 예상치 못한 지출이 발생합니다. OpenRouter 의 캐시 읽기(cache read) 비용은 DeepSeek 공식 API 대비 10배 가량 높아 실질 비용 차이가 큽니다. 사내 데이터 보안 기준에 맞춰 중국 외 프로바이더 지정, fallback 차단, ZDR 엔드포인트 적용 여부도 점검해야 합니다.

응답 속도와 tool calling 성공률 같은 운영 안정성도 함께 고려해야 합니다. 무조건 저렴한 엔드포인트를 골랐다가 호출 실패로 재시도가 반복되면 오히려 전체 토큰 비용이 늘어납니다. 시스템 상황과 데이터 규정에 맞춰 메인 에이전트 Sol 이 판단하고 Luna 나 DeepSeek 가 작업을 분담하는 구조를 완성해야 합니다.

모델별 특성을 고려한 에이전트 라우팅 설정이 인프라 비용을 결정합니다.

요약

  • 메인 설계 에이전트(Sol)와 하위 작업 에이전트(Luna/DeepSeek)를 분리하여 고성능 모델의 토큰 비용 부담을 크게 줄입니다.
  • OpenRouter 이용 시 단순 토큰 단가 외에 cache read 비용이 10배 이상 차이 날 수 있으므로 공식 API와 가격 조건을 정밀하게 비교해야 합니다.
  • 사내 에이전트 구축 시 데이터 처리 지역, ZDR 적용 여부, tool calling 성공률을 검토해야 재시도에 따른 비용 낭비를 방지할 수 있습니다.