구글이 자연어를 SQL 쿼리로 변환하는 Gemini-SQL2 기술을 공개했습니다. BIRD 리더보드에서 80.04%의 실행 정확도를 기록하며 기존 기록을 갈아치웠습니다. 속도가 매섭습니다.

80% 벽을 넘은 실행 정확도

Gemini-SQL2는 단순히 문법만 맞추는 수준을 넘어 실제 데이터베이스에서 작동하는 쿼리를 짜냅니다. 37개 분야의 방대한 데이터베이스를 대상으로 한 BIRD 벤치마크에서 거둔 성과입니다. 기존 버전이 기록한 76.13%를 가볍게 뛰어넘었습니다. 발전이 눈부시입니다.

하지만 현업의 벽은 여전히 높습니다. 인간 전문가 수준인 92.96%와 비교하면 아직 12.9%포인트의 격차가 존재합니다. 5번 중 1번은 쿼리가 틀릴 만큼 아직 빈틈이 존재합니다.

벤치마크에 쓴 데이터 규모는 33.4기가바이트(GB)에 달합니다. 실제 기업 환경에서 흔히 발생하는 불완전한 데이터와 외부 지식 활용 문제까지 포함한 결과입니다. 실제 실행 결과가 정답과 일치해야 점수를 주는 만큼 허들이 높습니다.

전문 모델과의 경쟁과 데이터 학습

이번 평가는 단일 학습 모델 부문에서 이뤄졌습니다. 구글이 공개한 자료를 보면 Gemini-SQL2는 여러 경쟁 모델을 제치고 가장 높은 자리에 올랐습니다. 일부 320억 매개변수급 전문 SQL 모델도 가볍게 제쳤습니다. 격차가 뚜렷합니다.

데이터베이스 작업에서 전문화된 학습이 얼마나 중요한지 보여줍니다. 범용 언어모델의 크기만 키우는 방식은 한계가 명확합니다. 특정 도메인에 특화한 튜닝이 성능을 좌우합니다. 성능은 학습이 가릅니다.

SaaS 기업들이 제공하는 데이터 조회 기능에도 바로 적용합니다. 사용자가 “업그레이드 후 90일 이내에 이탈한 고객의 지역별 매출을 보여줘"라고 입력하면 시스템이 쿼리를 자동 생성합니다. 복잡한 조인과 날짜 계산을 알아서 처리해 편의성이 대폭 향상됩니다.

빅쿼리 생태계와의 결합 시나리오

구글은 이 기술을 BigQuery Studio 와 AlloyDB AI 에 녹여냅니다. 개발자는 자연어로 데이터 변환 작업을 설명하고 생성된 SQL을 검토하는 방식으로 일합니다. 복잡한 윈도 함수나 날짜 계산을 수작업으로 짜는 지루한 시간이 줄어듭니다. 생산성이 높아집니다.

현업 데이터베이스는 컬럼명이 제각각이고 데이터 품질이 고르지 않습니다. Gemini-SQL2는 이런 현실적인 노이즈를 처리하는 데 집중했습니다. 비즈니스 담당자가 복잡한 지표를 직접 조회하는 환경도 머지않았습니다. 기대감이 높습니다.

다만 아직 별도의 API나 모델 식별자는 공개하지 않았습니다. 구글 클라우드 생태계 내부 제품군에 먼저 통합할 가능성이 큽니다. 기존 작업 흐름을 깨지 않고 자연스럽게 스며드는 방식을 택했습니다.

완벽한 자동화는 아직 멀었지만 데이터 추출의 진입 장벽이 낮아지는 흐름은 분명합니다. 엔지니어는 이제 쿼리 작성이 아니라 데이터 모델링과 정합성 검증에 더 집중해야 합니다.

요약

  • Gemini-SQL2는 BIRD 벤치마크에서 80.04% 실행 정확도를 달성하며 단순 문법 검증을 넘어 실제 쿼리 실행 기반의 평가에서 성과를 냈습니다.
  • 인간 전문가의 정확도(92.96%)와는 여전히 12.9%포인트의 격차가 존재하여 실무 적용 시 인간의 검토 단계가 필수적입니다.
  • 구글은 이 기술을 별도 API 대신 BigQuery Studio, AlloyDB AI 등 기존 클라우드 데이터 제품군에 우선 통합할 계획입니다.