오픈AI가 음성 데이터 처리를 지원하는 전용 API 모델 2종을 출시했습니다. 기존 음성 모델 라인업에 이어 전사 작업에 집중한 신규 모델입니다. 실시간 반응성과 대용량 일괄 처리라는 두 가지 필요성을 명확히 분리했습니다.

실시간 대응과 비동기 대량 처리의 이원화

실시간 처리를 맡는 GPT-Live-Transcribe 가 요구하는 핵심은 낮은 지연 시간입니다. 화상회의 자막이나 라이브 스트리밍, 실시간 고객 상담 시스템에 맞춘 구조입니다. 시끄러운 배경음이나 음악이 섞인 환경에서도 발화를 정교하게 구분합니다. 요금은 분당 0.017달러입니다.

반면 사전 녹음된 오디오 파일 처리에는 GPT-Transcribe 를 사용합니다. 회의록 작성이나 팟캐스트, 인터뷰 분석 같은 비동기 일괄 작업에 특화된 모델입니다. 실시간 대비 약 34배 빠른 속도로 오디오를 분석합니다. 요금은 1000분당 4.50달러로 책정하여 비용 효율을 높였습니다.

힌트 제공과 잡음 제어로 낮춘 단어 오류율

두 모델은 단순한 음성 변환을 넘어 문맥과 전문 용어 이해도를 높였습니다. 전사 요청 시 주제나 상황 설명, 특정 인명과 제품명, 약어를 힌트로 제공하면 정확도가 향상됩니다. 현장의 복잡한 음성도 한결 수월하게 처리합니다.

정확도를 측정하는 단어 오류율(WER) 지표에서도 성능 향상이 확인되었습니다. 22개 언어 대상 커먼 보이스(Common Voice) 평가에서 기존 Whisper 모델이 40.37%를 기록했던 반면, GPT-Transcribe 는 19.27%로 오류율을 크게 낮췄습니다. 실제 음성 환경을 반영한 9개 언어 테스트에서는 오류율을 8.98%까지 줄였습니다. 아티피셜 애널리시스 벤치마크에서는 WER 3.3%를 기록하며 9위에 올랐습니다.

음성 파이프라인을 구축하는 팀을 위한 선택

서비스 특성에 맞게 실시간 스트리밍 방식과 비동기 일괄 처리 방식을 나누어 도입할 수 있습니다. 음성 인프라를 다루거나 AI 파이프라인을 설계하는 엔지니어링 팀에게 유용한 선택지입니다.

요약

  • 실시간 저지연 처리(GPT-Live-Transcribe, 분당 $0.017)와 비동기 고속 처리(GPT-Transcribe, 1000분당 $4.50, 34배 속도)로 사용 목적에 따라 모델 선택이 가능해졌습니다.
  • 22개 언어 커먼 보이스 평가에서 WER 19.27%를 기록하며 기존 Whisper(40.37%) 대비 단어 오류율을 절반 이하로 줄였습니다.
  • 키워드, 주제, 인명, 약어 등 프롬프트 형태의 힌트 정보를 제공하여 전문 용어 및 도메인 특화 전사 정확도를 제어할 수 있습니다.