0.8B짜리 소형 모델이 특정 작업에서 GPT-5.6 Sol을 이겼습니다. Shopify가 Qwen3.5-0.8B를 특정 업무에 맞게 미세 조정한 결과인데요. 범용 AI를 그대로 쓰는 대신 실제 업무에서 나온 결과를 평가하고, 실패 데이터를 다시 학습에 넣어 모델을 계속 개선하는 방식을 사용했습니다. Shopify CEO Tobi Lütke는 이런 자기개선 학습 구조가 있다면 작은 모델도 특정 업무에서는 대형 모델보다 좋은 성능을 낼 수 있다고 설명했습니다. 이 학습 파이프라인을 만드는 기반 기술 Tangle도 오픈소스로 공개했습니다. 모든 업무에 비싼 대형 모델을 호출하는 대신, 반복 업무마다 작고 저렴한 전용 모델을 만들어 쓰는 방식이 꽤 빠르게 늘어날 것 같습니다.

모든 업무에 비싼 대형 AI 모델을 호출하는 방식은 비용 부담이 큽니다. Shopify는 특정 업무에 맞게 미세 조정한 Qwen3.5-0.8B 모델로 범용 대형 모델을 뛰어넘는 성과를 냈습니다. 파이프라인 구축 도구 Tangle을 오픈소스로 공개했습니다.

0.8B 규모 소형 모델이 특화 도메인에서 대형 모델을 앞선 배경에는 피드백 학습 구조가 있습니다. 실제 업무 결과를 지속 평가하고 실패 데이터를 다시 학습에 넣는 순환 고리를 설계했습니다. 이러한 파이프라인 환경이 작고 정밀한 전용 모델을 만듭니다.

소형 모델의 성과와 피드백 학습

작고 저렴한 전용 모델을 반복 학습시키는 구조가 대형 모델 범용 호출보다 효율적입니다. 실제 업무 현장에서 수집한 실패 데이터를 모델 학습으로 되돌리는 자기개선 방식을 적용했습니다. Shopify CEO Tobi Lütke는 이러한 학습 구조를 거치면 특화 업무에서 소형 모델이 대형 모델보다 우수한 성능을 낸다고 설명했습니다.

파이프라인 개발 도구 Tangle의 핵심 기능

Tangle은 시각 에디터 기반으로 복잡한 파이프라인을 구성합니다. 드래그 앤 드롭 방식으로 컴포넌트를 연결하고 매개변수를 조정합니다. 기존 코드를 컨테이너로 감싸 언어 제약 없이 통합하며, 중간 결과를 저장하는 Advanced Execution Caching 기능으로 연산 비용을 줄입니다.

특화 모델 중심의 개발 흐름

비싼 대형 모델 대신 전용 소형 모델을 연마하는 방식이 늘고 있습니다. 업무 데이터셋을 축적하고 파이프라인 도구로 학습을 자동화하여 단일 대형 모델 의존도를 낮춥니다.

소형 모델과 시각 파이프라인 도구의 결합은 현장 데이터 중심의 AI 운용 방식을 잘 보여줍니다.

요약

  • 실패 데이터를 재학습에 투입하는 피드백 고리가 소형 모델의 특정 도메인 성능을 극대화합니다.
  • Tangle은 드래그 앤 드롭과 캐싱을 지원해 시각적 ML 파이프라인 구축 및 실행 비용을 절감합니다.
  • 범용 대형 모델 개별 호출 대신 업무별 소형 특화 모델을 운영하는 AI 개발 패러다임이 확산하고 있습니다.