Mac에서 로컬 AI 돌린다면, Ollama 대신 oMLX? Apple Silicon 환경에 최적화된 로컬 AI 도구 ‘oMLX’가 공개됐습니다. Ollama나 LM Studio의 대안으로 사용할 수 있으며, KV 캐시를 SSD에 저장해 메모리 활용을 최적화하고 Qwen 3.8에도 최적화되어 있습니다. 특히 Claude Code와 Cursor 호환까지 지원해 Mac에서 로컬 모델을 코딩 에이전트와 함께 사용하고 싶은 분들에게 유용해 보입니다. GitHub:

Mac 환경에서 로컬 LLM을 운용하다 보면 메모리 부족과 추론 속도 저하에 자주 부딪힙니다. 기존 서버 도구들은 사용 편의성과 미세한 파라미터 제어 사이에서 하나를 포기하도록 만듭니다. Apple Silicon 통합 메모리 구조에 맞춰 최적화된 추론 서버 oMLX 가 나온 이유입니다.

KV 캐시 계층화와 연속 배칭

oMLX 는 메모리의 핫 티어와 SSD 기반의 콜드 티어로 KV 캐시를 계층화하여 관리합니다. 세션 중간에 입력 맥락이 변경되어도 과거 캐시를 그대로 보존하며 재사용합니다. 긴 문맥을 지속해서 주고받아야 하는 코딩 작업에서 메모리를 불필요하게 점유하지 않고 추론 효율을 끌어올립니다.

연속 배칭 기술을 지원하여 다중 요청을 효율적으로 처리합니다. 자주 사용하는 모델은 메모리에 선점해 두고 무거운 모델은 필요할 때 스왑하는 설정이 가능합니다. 메뉴바에서 모델별 컨텍스트 제한과 메모리 점유 상태를 유연하게 조율합니다.

에이전트 연동과 개발 생태계 확장

oMLX 는 Claude Code 및 Cursor 같은 코딩 에이전트와 매끄럽게 호환됩니다. MCP (Model Context Protocol) 연동 옵션을 기본으로 제공하여 로컬 에이전트가 모델의 맥락을 원활하게 활용하도록 돕습니다. 단순한 LLM 서버를 넘어 개발 생산성 도구의 백엔드로 작동합니다.

메뉴바 애플리케이션 설치 시 CLI 심 파일이 생성되어 터미널 환경이나 Apple Shortcuts 연동도 손쉽습니다. 실행 환경은 macOS 15.0 Sequoia 이상과 Apple Silicon 칩셋을 요구하며, Homebrew 명령어 한 줄로 편리하게 설치와 업데이트를 진행합니다.

최신 모델 커널 최적화와 운영 환경

oMLX 는 Qwen3.5, GLM-5.2, MiniMax M3 같은 모델 가속을 위한 네이티브 커널 빌드 옵션을 갖췄습니다. 빌드 시 전용 옵션을 적용하면 해당 모델 패밀리의 추론 성능을 보강합니다. 백그라운드 서비스로 등록해 두면 시스템 오류 발생 시 자동으로 재시작합니다.

로컬 환경에서 제어권과 추론 성능을 모두 챙기고 싶은 Mac 개발자에게 oMLX 는 실용적인 선택지입니다.

요약

  • 메모리의 핫 티어와 SSD의 콜드 티어로 KV 캐시를 계층화하여 메모리 효율과 대용량 컨텍스트 처리 성능을 동시에 확보했습니다.
  • Claude Code 및 Cursor 등 주요 코딩 에이전트 도구 및 MCP 지원으로 로컬 개발 생태계 통합이 수월합니다.
  • 메뉴바 관리 방식과 CLI 및 Apple Shortcuts 제어를 함께 제공하여 운영 편의성을 향상했습니다.