Rapid-MLX 소개
맥에서 로컬 모델을 돌리려면 보통 두 가지를 감수하게 됩니다. 하나는 llama.cpp 계열 런타임이 Metal 위에 얹히면서 생기는 성능 손해이고, 다른 하나는 도구 호출(tool calling)이 모델마다 다른 형식으로 나와 코딩 에이전트를 붙이면 텍스트가 그대로 튀어나오는 문제입니다. 로컬 추론을 실제 업무 흐름에 넣으려면 이 두 가지가 함께 풀려야 합니다.
Rapid-MLX는 Apple Silicon 전용으로 만든 로컬 추론 엔진입니다. llama.cpp 대체 경로나 Metal 중간 계층 없이 순수 MLX 커널 만 사용하고, 연속 배칭과 프롬프트 캐시, 양자화된 KV 캐시를 MLX의 대역폭 위에서 직접 돌립니다. 서버는 OpenAI와 Anthropic 양쪽 API 형식을 모두 제공하기 때문에, 클라이언트 쪽 어댑터 없이 기존 SDK를 그대로 붙일 수 있습니다.
프로젝트는 스스로를 "Apple Silicon을 위한 가장 빠른 로컬 AI 엔진" 이라고 소개하며 Ollama 대비 2~4배 빠르다고 밝히고 있습니다. 다만 저장소 README 안에는 이 수치를 뒷받침하는 벤치마크 표가 들어 있지 않고, 대신 rapid-mlx bench 로 각자의 맥에서 측정한 결과를 공개 표에 제출하는 방식을 안내합니다. 아래 내용에서 속도 수치는 저자의 주장으로 읽는 편이 안전합니다.
Rapid-MLX와 다른 로컬 실행 방식의 차이
| 항목 | 일반적인 로컬 런타임 | Rapid-MLX |
|---|---|---|
| 실행 백엔드 | llama.cpp 또는 Metal 중간 계층 | 순수 MLX 커널 |
| API 형식 | OpenAI 호환 위주 | OpenAI 계열과 Anthropic /v1/messages 동시 제공 |
| 도구 호출 | 모델별로 파서를 직접 맞춰야 함 | 별칭마다 파서를 지정하고 자동 복구를 시도 |
| 에이전트 검증 | 사용자가 직접 확인 | 릴리스마다 11개 에이전트를 실제 가중치로 배선 검증 |
| 모달리티 | 텍스트 중심 | 텍스트 기본, 비전과 음성, 영상은 선택 설치 |
기본 설치는 약 460MB의 텍스트 전용 구성입니다. 비전과 음성, 영상 생성, 임베딩, DFlash 추측 디코딩(speculative decoding)은 필요할 때 추가로 설치하는 확장으로 분리되어 있습니다.
Rapid-MLX 설치와 첫 실행
설치 경로는 여러 갈래인데, 별도로 Python을 관리하고 있지 않다면 Homebrew가 가장 단순합니다. homebrew-core 에 정식 등재되어 있어 별도 탭을 추가할 필요가 없습니다.
brew install rapid-mlx
한 줄 설치 스크립트는 맥의 RAM을 감지해 시작 모델까지 골라 줍니다. Python 3.10 이상을 필요하면 함께 설치하고, ~/.rapid-mlx/ 에 격리된 가상 환경을 만든 뒤 CLI를 ~/.local/bin/ 에 연결합니다.
curl -fsSL https://rapidmlx.com/install.sh | bash
설치 스크립트를 파이프로 실행하는 방식이 마음에 걸린다면, 릴리스 자산으로 배포되는 install.sh 를 내려받아 함께 제공되는 cosign 서명 SHA256SUMS.txt 로 검증한 뒤 실행하는 경로가 저장소의 SECURITY.md 에 정리되어 있습니다. PyPI 아티팩트에는 PEP 740 방식의 Sigstore 증명이 붙습니다.
모델과 대화하거나 서버로 띄우는 것은 각각 명령 하나입니다.
rapid-mlx chat # 기본 모델로 REPL 시작
rapid-mlx serve qwen3.5-4b-4bit # localhost:8000 에 OpenAI 호환 서버
서버가 뜨면 OpenAI SDK를 쓰는 클라이언트는 http://localhost:8000/v1 을, Claude Code와 Anthropic SDK는 http://localhost:8000 을 바라보게 하면 됩니다.
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
print(client.chat.completions.create(
model="default",
messages=[{"role": "user", "content": "Say hello"}],
).choices[0].message.content)

Rapid-MLX의 코딩 에이전트 연결
서버가 떠 있는 상태에서 명령 하나면 코딩 에이전트의 설정 파일을 대신 고쳐 줍니다.
rapid-mlx launch claude-code
Claude Code의 로컬 설정을 http://localhost:8000 으로 향하게 바꾸는 동작이라, 환경 변수를 직접 넣거나 JSON을 손으로 편집할 필요가 없습니다. cursor 와 cline, continue-dev 로 바꿔 쓸 수 있고, rapid-mlx launch list 로 현재 기기에서 감지된 대상을 확인합니다.
에이전트 지원 범위는 릴리스마다 실제 가중치로 검증됩니다. 11개 에이전트와 3개 파이썬 프레임워크가 통합 테스트 셀을 가지고 있고, 그중 Claude Code와 Codex CLI, Hermes, Aider 네 가지는 매 릴리스마다 최신 클라이언트 바이너리로 종단간 재검증하는 Tier-1로 분류됩니다. 나머지 일곱 개는 배선 검증만 하고 필요할 때 설정하는 Tier-2입니다.
프레임워크 쪽은 LangChain과 PydanticAI, smolagents가 목록에 있습니다. 그 밖에도 OpenAI 호환 클라이언트라면 URL 하나만 바꿔 붙일 수 있어 Cursor와 LibreChat, Open WebUI 등이 함께 언급되어 있습니다.
Rapid-MLX의 모델 선택 기준
설치 스크립트의 RAM 감지기가 고르는 기본값은 다음과 같습니다. 전체 목록은 rapid-mlx models 로 보고, 별칭별 파서와 KV 코덱 적용 여부 같은 세부 정보는 rapid-mlx info <alias> 로 확인합니다.
| RAM | 권장 모델 |
|---|---|
| 8~23GB (맥북 에어 및 프로) | qwen3.5-4b-4bit |
| 24~47GB (맥북 프로, 맥 미니) | gpt-oss-20b-mxfp4-q8 |
| 48~95GB (맥 스튜디오) | qwen3.6-35b-8bit |
| 96GB 이상 (맥 스튜디오, 맥 프로) | gpt-oss-120b-mxfp4-q8 |
등록된 별칭은 텍스트 165개와 음성 41개, 영상 8개를 합쳐 214개입니다.
Rapid-MLX의 음성과 영상 기능
음성 쪽은 /v1/audio/* 엔드포인트 뒤에 41개 별칭이 붙어 있어 OpenAI SDK를 그대로 씁니다. 음성 합성과 전사 외에 세 가지가 눈에 띕니다. indextts 는 참조 음성만으로 목소리를 복제하고, qwen3-tts-voicedesign 은 지정된 화자 없이 원하는 목소리를 자연어로 묘사하면 합성하며, qwen3-aligner 는 이미 가지고 있는 전사문과 음성을 함께 받아 글자 단위 타이밍을 돌려줍니다. 마지막 것은 단어를 추측하지 않으므로 잘못 알아들을 여지가 없고, 자막 싱크나 편집 작업이 필요로 하는 동작이 바로 이것입니다.
영상 생성은 OpenAI 호환 Videos API로 제공되며 Wan 2.1과 2.2, CogVideoX-Fun, LTX-2.3 세 가지 백엔드에 8개 체크포인트가 등록되어 있습니다. Python 3.11 이상과 ffmpeg 가 필요하고, 통합 메모리 고갈을 막기 위해 클립 생성은 한 번에 하나씩 직렬로 처리됩니다. 문서는 실시간이 아니라 영상 1초당 수 분의 연산을 예상하라고 적고 있습니다.
Rapid-MLX는 누구에게 유용한가
M 시리즈 맥을 쓰면서 코딩 에이전트를 로컬 모델로 돌려 보려는 사람에게 가장 잘 맞습니다. OpenAI와 Anthropic 두 형식을 모두 제공하고 주요 에이전트를 릴리스마다 검증하기 때문에, 붙였을 때 도구 호출이 깨지는 문제를 겪을 확률이 낮습니다. 반대로 NVIDIA GPU나 리눅스 서버에서 서빙할 계획이라면 이 프로젝트는 애초에 대상이 아닙니다. 성능 수치를 근거로 도입을 결정하려는 경우에도, 저장소에 비교 벤치마크가 실려 있지 않으므로 rapid-mlx bench 로 직접 측정해 보는 편이 낫습니다.
익명 통계 수집은 기본으로 꺼져 있고 rapid-mlx telemetry enable 로 명시적으로 켜야 동작하며, 프롬프트와 응답, 경로, IP, API 키는 수집하지 않는다고 밝히고 있습니다.
Rapid-MLX의 라이선스
Rapid-MLX는 Apache 2.0 라이선스로 공개되어 있어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다.
Rapid-MLX 공식 홈페이지
Rapid-MLX 문서 사이트
Rapid-MLX 모델 카탈로그
Rapid-MLX 프로젝트 GitHub 저장소
더 읽어보기
-
mlxcel: 애플 실리콘에 최적화된 Rust 기반의 LLM/VLM 추론 런타임 및 서버 (feat. lablup)
-
TurboFieldfare: 8GB 맥북에서 Gemma 4 26B를 약 2GB 메모리로 돌리는 Swift 런타임
-
mlx-vlm: M5와 같은 Apple Silicon에 최적화된 MLX 기반 시각-언어 모델(VLM) 추론 및 파인튜닝 도구
-
Lemonade: 로컬 GPU 및 NPU에서 구동되는 오픈소스 / 고성능 LLM 추론 서버 (feat. AMD)
이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. ![]()
이 도구를 직접 설치해 사용해보셨다면, 파이토치 한국 사용자 모임
회원들을 위해 경험이나 팁을 댓글로 남겨주세요! ![]()

