mlx-serve vs LM Studio vs Ollama 终极横评:本地 LLM 推理谁最快?26% 解码提速的真相 【免费下载链接】mlx-serveNative LLM inference server for Apple Silicon. OpenAI Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.项目地址https://gitcode.com/gh_mirrors/ml/mlx-serve点击查看免费下载如果你想在 Apple Silicon Mac 上做本地 LLM 推理大概率会在这三个方案之间纠结mlx-serve、LM Studio和Ollama。本文用同一台 M4 Max、同一份权重文件把三者的解码速度、Prefill 速度、API 能力和开箱成本摊开对比并解释 mlx-serve 官方宣称「比 LM Studio 快 26%」这个数字到底是怎么来的、在什么场景下你真正能拿到。测试口径来自 docs/performance.mdApple M4 Max 128GB四个引擎加载完全相同的 MLX 权重文件全部使用各自出厂默认配置默认 vs 默认不做逐模型调参由 llmprobe 统一测量每点取 3 次中位数。原始数据见 benchmarks.md。三大本地 LLM 引擎能力速览先不看速度看「能干什么」。这张表决定了你的迁移成本能力mlx-serveLM StudioOllamaMLX 原生模型✅✅几乎只支持 GGUFGGUF 模型✅内嵌 llama.cpp✅✅OpenAI 兼容 API✅✅部分Anthropic Messages APIClaude Code 直连✅ 部分❌Ollama API老工具无缝迁移✅❌✅ 原生投机解码MTP / drafter / PLD✅ 四种❌部分KV-Cache 量化4/8-bit✅❌部分连续批处理✅❌✅图片 / 视频 / 音乐 / 语音 / 3D 生成✅❌❌运行时依赖 Python❌约 7MB 单二进制❌❌许可证MIT闭源MIT一个关键差异mlx-serve 同时说三种「协议」——OpenAI Chat/Responses、Anthropic Messages 和 Ollama API 都跑在同一个端口默认11234。这意味着你现有的 Raycast、Obsidian、Open WebUI 等 Ollama 工具改个地址就能用Claude Code 也能直连。完整端点清单在 docs/api.md。v26.8.3 在 M4 Max 上的默认配置对比mlx-serve 几何平均解码 26%、Prefill 36%相对 LM Studio。注意 Qwen 3.6 27B 一行——差距主要来自 MTP 投机解码。解码速度实测26% 是平均数形状比平均数更重要上面这张图是「默认 vs 默认」的完整矩阵。单看平均数会漏掉两个重要事实详细解读见 docs/faq.md稠密模型的纯解码已经追平。在 Gemma 4 E4B 上LM Studio 与 mlx-serve 的差距只有 -0.5%-0.8%基本打平——LM Studio 在这块跟上了。拉开差距的是 Prefill 和投机解码。Gemma 4 E4B 的 Prefill 快了 117%而在 Qwen 3.6 27B 上mlx-serve 会自动加载 checkpoint 自带的 MTP多 token 预测头LM Studio 则不加载同文件解码直接145%。如果开启各引擎可选的投机加速组件mlx-serve 的 drafter / MTP差距进一步放大蓝色为 mlx-serve 最佳可用配置Gemma 4 E4B 开 drafter 后 118→178 tok/s98%Qwen 3.6 27B 开 MTP 后 66→157 tok/s278% vs 自身基线。相对 oMLX 与 MTPLX在自己的主场也不落下风公平起见mlx-serve 也在对手「最擅长的检查点」上打过vs oMLXoQ4e 构建解码23%Prefill 打平vs MTPLXMTPLX-Optimized 构建解码10%、Prefill17%首 token 时间 494ms vs 1528ms——快了 3 倍。MTPLX 是目前 Qwen MTP 模型的标杆运行时这张图展示了长上下文下各家的 Prefill/解码爬坡26% 解码提速的真相四种投机解码「26%」不是玄学主要来自默认开启的投机解码。mlx-serve 内置四种全部与贪心解码等价temp0 时逐字节一致Native MTPQwen 3.5/3.6/3.8模型自带的多头预测头直接起草控制器按请求自适应调整深度零配置DFlash 伴生 drafter模型目录可自带drafter/随模型自动加载PLD提示词查找解码与模型无关的 n-gram 匹配在 Agent 循环、RAG、代码编辑等「答案会复述提示词」的场景收益最大默认开启Gemma 4 交叉注意力 drafter官方小起草模型可选加载。关键设计是自适应门控遇到全新内容创意写作、一次性问答时自动关闭投机不付验证开销接受率跌破盈亏平衡时中途停用。所以「26%」是真实拿到的默认收益而不是某个最佳配置的天花板——反过来在 Agent 编程场景实测收益能到 98%278%见上图。Qwen 3.8 移植 MTP 验证器时的全上下文扫描1K→1M也显示解码增益在长上下文下持续扩大Ollama 用户3 步无缝迁移到更快的引擎mlx-serve原生实现 Ollama API/api/chat、/api/generate、/api/pull等CLI 也是熟悉的 Ollama 风格。对 Apple Silicon 用户它可以直接替换 OllamaGGUF 模型跑在相同的内嵌 llama.cpp 上但额外获得 MLX 原生路径、Metal 定制内核和投机解码——在 GGUF 对比中 mlx-serve 也比 Ollama 快约 15%估算值因为 Ollama 无法跑 MLX。brew install mlx-serve # 或 brew install --cask mlx-serve 安装 App mlx-serve run gemma4 # 自动下载、起服务、终端直接开聊一条命令完成下载 起服务 REPL 对话模型落在共享目录~/.mlx-serve/models所有参数见 docs/cli.md不只是聊天Agent 与多模态生成是独家项mlx-serve 附带原生 macOS 菜单栏 AppMLX Core非 Electron多会话聊天、Agent 模式 MCP 工具调用、模型浏览器以及 LM Studio / Ollama 都没有的图片、视频、音乐、语音克隆、3D 生成——全部本地 MLX 完成Agent 模式内置 10 个工具shell、文件读写、搜索、网页浏览等并支持一键拉起 Claude Code 等编程 Agent结论选哪个本地 LLM 推理引擎要速度、要 Agent 工作流、要多模态生成→mlx-serve。默认配置就比 LM Studio 快 26%开启投机解码后 Agent 场景翻倍OpenAI/Anthropic/Ollama 三协议同端口迁移成本最低只想点鼠标聊天、不写脚本→ LM Studio 依然是最省心的选择稠密模型速度与 mlx-serve 打平只是没有投机解码、KV 量化和 API 深度多平台/非 Apple 硬件、轻量需求→ Ollama 生态最成熟但在 Mac 上把地址改成http://localhost:11234指向 mlx-serve 后同样的工具链直接提速。想自己复现基准或继续调优完整方法学与调参指南见 docs/performance.md中文性能文档在 docs/zh-CN/performance.md常见问题含「是否比 LM Studio 快」的逐模型拆解见 docs/faq.md。赞分享【免费下载链接】mlx-serveNative LLM inference server for Apple Silicon. OpenAI Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.项目地址https://gitcode.com/gh_mirrors/ml/mlx-serve点击查看免费下载相关推荐终极指南三大LLM推理引擎性能对比 - Ollama vs vLLM vs TensorRT-LLM终极指南三大LLM推理引擎性能对比 Ollama vs vLLM vs TensorRT LLM 在大语言模型快速发展的今天选择合适的 LLM推理引擎 对于教程人工智能大模型Nxtscape本地LLM完整配置指南Ollama与LM Studio终极教程Nxtscape本地LLM完整配置指南Ollama与LM Studio终极教程 想要在Nxtscape智能浏览器中体验本地AI的强大功能吗本教程将手把手教你大模型AI Agent浏览器控制MCP 服务代码智能体GUI 自动化前端后端桌面应用Qwen1.5量化推理速度llama.cpp vs mlx-lm性能对比Qwen1.5量化推理速度llama.cpp vs mlx lm性能对比 你是否在寻找本地运行大语言模型LLM的最佳方案面对众多量化工具和部署框架如何人工智能大模型Qwen模型评测示例工程本地部署教程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考