
oMLX 快速上手教程5 分钟在 Mac 上跑起第一个本地大模型【免费下载链接】omlxLLM inference server with continuous batching SSD caching for Apple Silicon — managed from the macOS menu bar项目地址: https://gitcode.com/GitHub_Trending/om/omlxoMLX 是一款免费开源的 LLM 推理服务器专为 Apple SiliconM 系列芯片优化它支持连续批处理、SSD 冷热分层 KV 缓存还可以直接在 macOS 菜单栏管理。跟着这篇本地大模型部署教程5 分钟就能让大模型在 Mac 上离线跑起来。环境要求与安装 oMLX 的两种方式运行 oMLX 本地大模型服务只需满足三个条件Apple Silicon 芯片M1 / M2 / M3 / M4 / M5macOS 15.0Sequoia及以上Python 3.11 – 3.13安装官方 macOS 应用时无需手动配置方式一下载 macOS 菜单栏应用推荐新手从 Releases 页面下载.dmg拖入「应用程序」文件夹即完成安装。应用自带一键自动更新并会安装轻量 CLI 垫片~/.omlx/bin/omlx方便终端控制服务。首次启动会弹出欢迎向导按三步走即可oMLX 快速上手教程欢迎向导三步配置模型目录、端口并启动本地大模型服务器Step 1 初始配置确认 Base Directory、Model Directory默认~/.omlx/models与端口默认 8000Step 2 Start Server点击按钮启动本地推理服务Step 3 Open Settings打开管理面板准备下载模型方式二Homebrew 一键安装如果你习惯命令行两条命令装好 oMLX 推理服务器brew tap jundot/omlx https://gitcode.com/GitHub_Trending/om/omlx brew install jundot/omlx/omlx随后用生命周期命令管理后台服务崩溃自动重启omlx start # 启动后台服务 omlx stop # 停止 omlx restart # 重启日志分别在~/.omlx/logs/server.log结构化应用日志和$(brew --prefix)/var/log/omlx.log服务日志。 临时体验也可以用前台模式直接跑omlx serve --model-dir ~/models服务会默认监听 8000 端口模型目录自动发现。用内置下载器获取你的第一个模型打开浏览器访问管理面板http://localhost:8000/admin切换到Downloader选项卡即可在面板内直接搜索并下载 Hugging Face 上的 MLX 格式模型选择建议M1 / M2优先选 4bit 量化、参数 7B 左右的模型M3 / M4 / M5 及以上可挑战 30B 级别的中型模型注意磁盘空间面板会显示每个模型的文件大小下载完成后模型自动落入模型目录服务器会按类型自动识别LLM / VLM / OCR / Embedding / Reranker无需任何手动配置。打开内置 Chat 界面与大模型对话进入面板的Chat选项卡选择已加载的模型即可直接对话内置 Chat 支持会话历史、模型切换、暗色模式、推理模型输出展示视觉模型VLM还能直接上传图片提问。到这里你的第一个本地大模型就跑起来了 想测速面板里的一键 Benchmark 会分别测出PPPrefill与TGToken Generation每秒 token 数并包含前缀缓存命中的真实场景数据。管理面板与 API像用 OpenAI 一样用 oMLXStatus 主面板实时展示服务状态与统计数据面板顶部还直接给出可用的 API 端点OpenAI 兼容 APIhttp://localhost:8000/v1Anthropic 兼容 APIhttp://localhost:8000任何 OpenAI 兼容客户端都能直接接入例如curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model: your-model, messages: [{role: user, content: 你好}], stream: true}菜单栏 App 让管理更轻量不打开终端即可启停服务、查看持久化服务统计崩溃自动拉起。进阶能力速览能力一句话说明 冷热分层 KV 缓存热数据驻留内存冷数据落 SSD即使服务器重启历史上下文依然可复用无需重新计算⚡ 连续批处理多请求并发混批推理默认最大并发 8可用--max-concurrent-requests调整 多模型管理LRU 自动淘汰、手动加载/卸载、模型固定Pinning、按模型 TTL 空闲卸载 工具调用与结构化输出支持 Qwen、Llama、DeepSeek、GLM 等主流模型家族兼容 MCP 生态集成面板内一键配置 OpenClaw、OpenCode、Codex、Hermes、Copilot、Pi️ 多 Mac 集群实验性把一个大模型拆分到不同内存的多台 Mac 上联合推理常见问题FAQ内存不够 / 想限制内存上限启动时加--memory-guard safe或--memory-guard-gb 48设置内存护栏默认上限为「系统内存 − 8GB」避免整机 OOM。端口被占用在欢迎向导或管理面板中修改端口或用omlx serve --model-dir ~/models配合环境变量OMLX_PORT。想启用 SSD 缓存omlx serve --model-dir ~/models --paged-ssd-cache-dir ~/.omlx/cacheKV 块将以 safetensors 格式落盘前缀命中时从磁盘恢复而非重算。国产镜像加速可加--hf-endpoint https://hf-mirror.com指定 Hugging Face 镜像端点。项目关键路径速查模块路径项目说明README.md中文文档README.zh.mdmacOS 菜单栏应用源码apps/omlx-mac/Sources/服务端主入口omlx/server.py命令行入口omlx/cli.py管理面板前端模板omlx/admin/templates/OpenAI API 适配层omlx/api/adapters/openai.pyHomebrew 安装配方Formula/omlx.rb小结oMLX 让「在 Mac 上跑本地大模型」这件事变得像装一个 App 一样简单——菜单栏管理、SSD 缓存、多模型并发、OpenAI 兼容 API 全部开箱即用。装好、下载模型、打开 Chat5 分钟即可拥有完全离线、数据不出本机的大模型推理服务。祝你使用愉快【免费下载链接】omlxLLM inference server with continuous batching SSD caching for Apple Silicon — managed from the macOS menu bar项目地址: https://gitcode.com/GitHub_Trending/om/omlx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考