Kev도 나왔다네요! 아래는 Jev와 비교한 내용이에요 단순 ‘예/아니오’를 넘어 ‘선택지별 가중치와 점수’ 반환 기존 Jev가 주로 단순 “예/아니오” 식의 이진 판단 위주였다면, Kev는 객관식 다중 선택과 1~5점 척도 평가까지 한 번에 처리함. 단순히 정답 하나만 딱 고르는 게 아니라, 각 선택지별로 정밀한 ‘확률 가중치’를 뽑아줌. 예: 복합 문의가 들어오면 [반품 47%, 배송 28%, 결제 25%]처럼 미묘한 비율까지 1번의 연산으로 완벽히 분석해 냄. 여러 질문을 동시에 던져도 ‘상호 간섭 0’ (독립 격리) “담당 부서”, “긴급 대응 필요 여부”, “고객 불만 점수"를 한 번에 물어봐도, 각 질문이 서로 영향을 주지 않도록 완벽히 분리된 상태에서 단 ‘1번의 Forward Pass’로 수십 밀리초 만에 동시 판별함. 폐쇄형 유료 서비스 vs 100% 내 맘대로 학습하는 오픈소스 Jev는 입력 데이터 보관 정책 논란이 있고 커스텀이 불가능한 폐쇄형 API였음. Kev는 터보레포 창시자 Jared Palmer가 만든 Apache 2.0 완전 오픈소스임. 사내 업무 데이터 수백 개만 넣으면 우리 회사만의 규칙에 맞게 초고속 미세조정(LoRA) 가능. 내 맥북에서 로컬 구동 (비용 0원 & 데이터 유출 제로) 0.8B, 4B, 9B 모델 가중치가 모두 공개되어 있음. 비싼 클라우드 API나 데이터 유출 걱정 없이, 내 로컬 환경(Mac M시리즈/CUDA)에서 무료로 무제한 구동 가능. :링크: 깃허브:

유료 폐쇄형 서비스였던 Jev의 구조를 그대로 구현한 오픈소스 의사결정 모델 Kev가 공개되었습니다. 터보레포(Turborepo) 창시자인 Jared Palmer가 공개한 프로젝트입니다. Qwen3.5를 기반으로 개발되었으며 Apache 2.0 라이선스로 작동합니다. 사내 데이터를 외부에 유출하지 않고 로컬에서 직접 구동합니다.

단 한 번의 연산으로 다중 질문 분석

기존 의사결정 모델이 단순한 예/아니오 판단에 그쳤다면 Kev는 훨씬 구체적인 선택지를 제공합니다. 객관식 다중 선택과 1-5점 척도 평가를 한 번의 요청으로 처리합니다. 입력 텍스트 하나에 여러 질문을 던져도 각 질문은 독립적으로 처리합니다. 질문 사이의 상호 간섭이 전혀 발생하지 않습니다.

단 1회의 신경망 추론(Forward Pass)으로 수십 밀리초 만에 빠르게 판별을 마칩니다. 복합 고객 문의가 들어왔을 때 반품, 배송, 결제 카테고리별 확률 가중치를 한 번에 계산합니다. 각 선택지별 점수를 확률로 세분화하여 반환하므로 서비스 분기 로직을 정교하게 구성합니다.

로컬 환경과 오픈소스 생태계 지원

파라미터 크기는 0.8B, 4B, 9B의 세 가지로 제공합니다. 비싼 클라우드 비용을 지불할 필요가 없습니다. Apple Silicon의 MLX를 비롯해 CUDA와 ROCm 환경을 모두 지원합니다. 4B와 9B 모델은 32GB 메모리를 탑재한 Mac에서도 무리 없이 구동합니다.

TypeSafe의 System One API 규격을 따르고 있어 기존 Python SDK를 그대로 연결합니다. 사내 업무 데이터셋 수백 건만 준비하면 LoRA 미세조정도 쉽게 수행합니다. 모델 가중치가 완전히 열려 있어 보안이 중요한 금융이나 의료 분야에서도 부담 없이 도입하기 적합합니다.

설치와 서비스 구동 방법

Python 3.12 또는 3.13 환경에서 패키지 관리자 uv로 간편하게 실행 환경을 구축합니다. 서버 실행 명령어를 입력하면 첫 구동 시 기본 모델과 어댑터를 자동으로 다운로드합니다.

git clone https://github.com/jaredpalmer/kev.git
cd kev
uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009

서버를 띄운 후 REST API로 텍스트와 함께 질문 목록을 전달하면 즉시 분류 결과를 받습니다. 웹 브라우저에서 바로 테스트하는 브라우저 플레이그라운드 공간도 함께 제공합니다. 가볍고 빠른 경량 판별 모델을 찾는 엔지니어에게 훌륭한 선택지입니다.

요약

  • Kev는 Qwen3.5를 기반으로 Jev의 다중 질문 처리 구조를 재현한 Apache 2.0 완전 오픈소스 모델입니다.
  • 단 한 번의 신경망 추론으로 질문 간 간섭 없이 확률 가중치와 척도 평가를 빠르게 계산합니다.
  • 0.8B부터 9B 크기 모델을 제공하여 Apple Silicon 및 일반 GPU 환경에서 무료로 로컬 구동이 가능합니다.