별도의 CUDA 기반 엔비디아 GPU나 클라우드 서버 없이 맥북에서 270억 개 매개변수 모델을 직접 실행합니다. 개발자 조나단 코레티가 알리바바의 오픈소스 모델을 개조한 Qwen3.8-27B-Uncensored-GGUF 모델을 공개했습니다. 가드레일을 크게 낮춘 변형 모델로 애플 실리콘 통합 메모리를 적극 활용합니다.

가드레일을 무력화한 수학적 변환 방식

이번 모델은 추가 데이터 학습 없이 가중치 수준에서 가드레일을 약화했습니다. 가중치 행렬에 수학적 변환을 적용하는 어블리터레이티드(abliterated) 기법을 사용했습니다. 답변 거부를 유도하는 메커니즘만 선택적으로 조정했습니다.

유해 프롬프트 테스트에서 거부 횟수가 확연히 줄었습니다. 100개 프롬프트 중 원본 모델이 98회 거부한 반면 무삭제 버전은 12회만 거부했습니다. 차이가 명확합니다. 다만 무삭제라는 표현이 모든 안전장치의 완벽한 제거를 의미하지는 않습니다.

27B 멀티모달 기반 모델의 성능과 양자화

기반이 되는 큐원 3.8 27B는 270억 개의 매개변수를 갖춘 밀집형 멀티모달 모델입니다. 텍스트뿐만 아니라 이미지와 영상 입력까지 수용합니다. 네이티브 컨텍스트 창은 최대 26만 2144토큰에 달하며 도구 사용과 추론 모드도 함께 지원합니다. 코딩이나 연구 보조 작업에 적합합니다.

다양한 비트의 양자화 포맷을 지원해 로컬 접근성을 높였습니다. GGUF와 MLX 포맷으로 각각 2, 4, 6, 8비트 양자화 파일을 제공합니다. 덕분에 Ollama나 LM Studio 같은 로컬 AI 실행 환경에 바로 올려 실행합니다. 설치가 간단합니다.

애플 실리콘 메모리 요구사항과 활용 분야

통합 메모리 용량에 따라 실제 체감 성능이 다릅니다. 가장 작은 양자화 모델도 최소 16GB 이상의 통합 메모리를 요구합니다. 가중치 저장 외에도 운영체제 영역과 긴 컨텍스트 처리를 위한 KV 캐시가 메모리를 사용하기 때문입니다.

16GB 사양의 맥북에서는 모델 구동은 가능하지만 속도 저하가 나타납니다. 반면 64GB 이상 메모리를 갖춘 고사양 맥북에서는 27B 모델을 안정적으로 운용합니다. 오프라인 환경에서 취약점 분석이나 침투 테스트를 진행하는 사이버보안 연구진에게 유용한 도구입니다.

클라우드 의존 없이 대형 멀티모달 모델을 오프라인에서 검증하는 로컬 환경이 확산합니다.

요약

  • 추가 학습 없이 가중치 행렬 변환(abliterated)만으로 안전 거부율을 98%에서 12%로 대폭 낮췄습니다.
  • 애플 실리콘 통합 메모리와 GGUF/MLX 양자화를 결합하여 엔비디아 GPU 없이 맥북에서 27B 멀티모달 LLM을 띄울 수 있습니다.
  • 모델 가중치 외에도 KV 캐시와 OS 메모리 점유가 커서 오프라인 27B 모델 운용에는 64GB 이상 메모리가 권장됩니다.