MiniCPM5-2B 端侧大模型完整实战指南:架构、RL+OPD 训练配方与多框架部署微调 大模型本地部署模型量化微调LoRA工具调用openBMBAscend【免费下载链接】MiniCPMMiniCPM4 MiniCPM4.1: Ultra-Efficient LLMs on End Devices, achieving 3 generation speedup on reasoning tasks项目地址https://gitcode.com/OpenBMB/MiniCPM点击查看免费下载MiniCPM5-2B 是 OpenBMB 开源社区 MiniCPM5 系列继 1B 之后发布的第二个端侧稠密模型面向本地助手、coding agent、工具调用与资源受限推理场景采用标准LlamaForCausalLM架构原生支持 131,072 token 上下文并配套完整的部署 / 微调 Cookbook 与 Agent Skills。本文以仓库 README-cn.md 为骨架结合仓库内 docs/deployment 系列部署指南、skills 目录下的 Agent Skills 与 tool_parsers/minicpm5xml_tool_parser.py 等源码级资料系统讲解 MiniCPM5-2B 的模型规格、UltraData 三阶段训练流程、RL OPD 后训练机制、四大主流推理框架的快速上手、XML 工具调用、以及面向 9 大推理后端与 5 大微调框架的 Cookbook 选型。读完本文你将掌握从模型下载、采样参数调优、多引擎部署到工具调用与微调适配的完整实战路径。一、MiniCPM5 系列概览与模型下载1.1 系列亮点MiniCPM5 系列是面向端侧、本地部署与资源受限场景的稠密 Transformer 模型。当前版本发布节奏如下时间版本说明2026.09.07MiniCPM5-2B系列第二个模型将 1B 训练方案扩展到 2B 参数规模配套部署 / 微调 Agent Skills2026.05.19MiniCPM5-1B系列首个模型1B 稠密 TransformerMiniCPM5-2B 的核心亮点同尺寸开源模型 SOTA在与同尺寸优秀开源模型的对比范围内达到 SOTA 水平整体表现可与 4B 级模型竞争在代码、数学、长文本、工具调用和 Agent 任务上展现出明显优势平均分 53.9超过参与对比的全部更大规模模型中的最高分 51.1。开放高质量数据与模型一同开源训练数据均属于 UltraData 数据体系包括高质量网页预训练数据集 UltraX、L0–L3 分级代码治理数据集 UltraData-Code、50 万条 Agent 训练样本 UltraData-SFT-Agent-2609、以及覆盖数学 / 代码 / 通用知识与长文本推理的超 8 万条 RL 训练样本 UltraData-RL-2609。上述达到 SOTA 水平超越 4B 级模型等表述均为仓库 README-cn.md 在特定对比模型集合下的原始声明读者应结合对比范围与评测基准理解不宜无限外推。1.2 模型下载渠道当前发布版本为 MiniCPM5-2B / MiniCPM5-1BBF16 / GGUF / MLX可在 HuggingFace 与 ModelScope 双平台获取。MiniCPM5-2B 提供以下变体变体用途MiniCPM5-2B主模型BF16 / FP16MiniCPM5-2B-SFTSFT 后版本MiniCPM5-2B-Midtrainmid-training 阶段版本MiniCPM5-2B-Base基座版本MiniCPM5-2B-GGUFGGUF 量化格式llama.cpp / Ollama / LM StudioMiniCPM5-2B-MLXMLX 格式Apple SiliconMiniCPM5-2B-GPTQGPTQ 量化格式MiniCPM5-2B-DSparkDSpark 投机采样草稿模型MiniCPM5-1B 提供主模型、SFT、Base、GGUF、MLX 等变体。其他重点版本还包括 MiniCPM-SALA、MiniCPM4.1-8B、MiniCPM4-0.5B以及早期 MiniCPM4 系列量化 / 投机变体GPTQ、AutoAWQ、Marlin、GGUF、MLX、Eagle3、BitCPM4 三值量化系列与 MiniCPM3/2B/1B 历史版本详见 README-cn.md 中的完整下载表格。二、MiniCPM5-2B 模型规格与架构MiniCPM5-2B 采用标准LlamaForCausalLM架构关键规格如下项目数值架构标准LlamaForCausalLM参数量2,516,756,480非 Embedding1,981,982,720层数42注意力头GQAQ 16 / KV 2上下文长度131,072128K标准架构带来的直接收益是部署生态的极大简化主流推理引擎可直接加载无需自定义算子也无模型代码 fork。这一点在仓库的多份部署文档中得到印证docs/deployment/transformers.md 明确说明MiniCPM5-1B and MiniCPM5-2B are standardLlamaForCausalLMmodels, so they load directly viaAutoModelForCausalLM— no custom modeling code, notrust_remote_codedocs/deployment/vllm.md 指出 vLLM0.21原生支持无需自定义 kernelskills/minicpm5-deploy/SKILL.md 中补充了跨后端的关键实现细节max_position_embeddings131072、rope_theta5e6、无需 rope-scaling且tie_word_embeddingsfalse未绑定 lm_head量化 / 转换工具若假设 Llama 默认的 tied 结构会静默丢弃lm_head导致输出退化为随机 token——MLX 相关 Skill 已内置该修复。三、训练流程UltraData 分级数据与三阶段训练MiniCPM5-2B 的训练过程是 UltraData 分级数据管理体系 的一次完整实践覆盖base training、mid-training 与后训练三个阶段。3.1 Base training 与 mid-trainingBase training采用逐级推进的训练配方包含 stable training 与 decay training用于建立基础语言能力与训练稳定性mid-training进一步强化目标能力并适配数据分布。训练语料来自同步开源的数据集Ultra-FineWeb、Ultra-FineWeb-L3、UltraX、UltraData-Code 与 UltraData-Math。3.2 后训练SFT → RL → OPD后训练阶段分为三步SFT使用400B tokens deep-thinking SFT建立深度思考和通用对话能力相关数据开源为 UltraData-SFT-2605 与 UltraData-SFT-Agent-260950 万条 Agent 训练样本RL针对数学、代码、Agent 和写作等方向训练专用RL teacher相关数据开源为 UltraData-RL-2609超 8 万条高质量 RL 训练样本OPDOn-Policy Distillation将这些 teacher 的能力蒸馏回同一个发布模型实现多专家能力合并。四、RL OPD后训练的关键环节RL OPD是 MiniCPM5-2B 后训练中的核心机制也是区别于常规 SFT-only 模型的关键设计。4.1 RL 阶段critic-based 算法RL 阶段使用了 JustRL II 阐述的critic-based 算法大幅提升训练稳定性并在多个领域取得显著收益。在仓库 README-cn.md 列出的基准中RL OPD 在推理与通用能力上平均提升↑ 10.96 分Agent 能力平均提升↑ 6.96 分。4.2 OPD 阶段反向 KL 蒸馏与专家合并OPD 阶段对16 个 RL 训练所得的专家模型含 5 个 agentic 专家模型实现能力合并其工程实现有两个要点训练方式在 response 序列的每个位置分别对学生模型和教师模型的 logits 计算全词表的反向 KL 散度作为优势估计值替代原有的 verification-based advantage训练数据直接复用各 RL teacher 训练时的 prompt 作为蒸馏数据无需额外构造语料。这一同分布 prompt 反向 KL的设计与 MiniCPM5-1B 的 OPD 实现一脉相承——1B 版本在此基础上还引入了双边 top-k 采样后取并集再计算反向 KL 的改进以平衡监督信号准确性与训练效率详见 README-cn.md 的 MiniCPM5-1B 章节。五、快速上手四大推理框架部署指南5.1 采样参数建议MiniCPM5-2B 生成时建议使用temperature1.0, top_p0.95, min_p0.0如果遇到重复输出请尝试temperature1.0, top_p0.95, min_p0.0, repetition_penalty1.05注意不同推理框架对采样参数的支持程度有所差异。特别地llama.cpp 默认min_p0.05会过滤掉概率低于最高概率 token 5% 的 token——这种过滤可能恰好过滤掉模型摆脱重复循环所需的 token反而引发重复因此必须显式设为0.0。5.2 vLLMOpenAI 兼容服务pip install vllm0.21 vllm serve openbmb/MiniCPM5-2B --port 8000测试请求curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: openbmb/MiniCPM5-2B, messages: [{role: user, content: 你是谁可以简单介绍一下自己吗}], max_tokens: 128, temperature: 1.0, top_p: 0.95 }docs/deployment/vllm.md 提供了更完整的调优参数--max-model-len默认 131072原生 128K小显存 GPU 可降至 8192 / 32768 释放 KV-cache--gpu-memory-utilization默认 0.85共享 GPU 上需调低vLLM 在 free/total 小于该值时硬失败--dtype默认 bfloat16老 GPU 可用 float16--enforce-eager用于小显存下 CUDA graphs OOM 的场景。服务启动后可通过chat_template_kwargs: {enable_thinking: true}显式控制思考模式。5.3 SGLangOpenAI 兼容服务pip install sglang[srt]0.5.16 python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000测试请求curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: openbmb/MiniCPM5-2B, messages: [{role: user, content: 你是谁可以简单介绍一下自己吗}], max_tokens: 128, temperature: 1.0, top_p: 0.95 }投机采样DSpark仓库同步开源了为 MiniCPM5-2B 训练的 DSpark 草稿模型 MiniCPM5-2B-DSpark。在 SGLang 中启用后可加速解码且不改变目标模型的输出python -m sglang.launch_server \ --model-path openbmb/MiniCPM5-2B \ --trust-remote-code \ --speculative-algorithm DSPARK \ --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark \ --speculative-dspark-block-size 7 \ --port 30000skills/minicpm5-deploy/SKILL.md 还提示SGLang 部署时若需使用完整 128K 窗口应显式传入--context-length 131072。若想使用 SGLang 的 Engine API 做离线批量推理可参考 docs/deployment/sglang.md 中的sgl.Engine示例。5.4 llama.cppGGUF 本地推理llama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080 -ngl 99 -c 8192 --jinja上例中-c 8192设置上下文长度为 8192可按需调整。测试请求curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: MiniCPM5-2B, messages: [{role: user, content: 11?}], temperature: 1.0, top_p: 0.95, min_p: 0.0, max_tokens: 256 }仓库发布的标准 GGUF 构件见 docs/deployment/llama_cpp.md文件大小适用场景MiniCPM5-2B-F16.gguf5.04 GB参考质量CPU/GPU 性能均衡MiniCPM5-2B-Q8_0.gguf2.68 GB相对 F16 质量损失极小磁盘减半MiniCPM5-2B-Q4_K_M.gguf1.56 GB端侧 / 移动级硬件极小显存这些 GGUF 可直接用于 vanilla llama.cpp 以及所有基于 llama.cpp 的运行时Ollama / LM Studio / llama-cpp-python。5.5 TransformersPython 本地推理GPU CPUpip install -U transformers5.6 accelerate torchfrom transformers import AutoModelForCausalLM, AutoTokenizer model_id openbmb/MiniCPM5-2B tokenizer AutoTokenizer.from_pretrained(model_id) model AutoModelForCausalLM.from_pretrained( model_id, torch_dtypeauto, device_mapauto, ) messages [{role: user, content: 你是谁可以简单介绍一下自己吗}] inputs tokenizer.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, enable_thinkingTrue, return_dictTrue, return_tensorspt, ).to(model.device) outputs model.generate(**inputs, max_new_tokens128) print(tokenizer.decode(outputs[0][inputs[input_ids].shape[-1]:], skip_special_tokensTrue))docs/deployment/transformers.md 进一步给出了 CPU-only 推理方案torch_dtypetorch.float32device_mapcpu有足够系统内存即可以及 PEFT LoRA 推理方案——基于该基座训练的 adapter 可直接通过PeftModel.from_pretrained加载无需任何额外处理。六、工具调用Tool Calling工具调用推荐使用 SGLang。MiniCPM5-2B 以XML 格式产出工具调用SGLang 内置的minicpm5parser 会自动将其转换为 OpenAI 兼容的tool_calls字段python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000 \ --tool-call-parser minicpm5 # 或--tool-call-parser auto启动后按标准 OpenAI 风格传入tools即可触发模型产出 XML 工具调用SGLang 负责转换为标准tool_calls请求示例见 docs/deployment/sglang.md其中包含get_weather这类典型 function schema。vLLM 侧的 XML parservLLM 侧同名 parser 的 PR 已合入上游 main 分支但尚未进入 pip release作为桥接方案仓库将同一份解析器代码随仓库发布在 tool_parsers/minicpm5xml_tool_parser.py。从源码看tool_parsers/minicpm5xml_tool_parser.py它注册为ToolParserManager.register_module(minicpm5)的MiniCPM5XMLToolParser类支持容错归一化_normalize_model_output处理 SentencePiece/GPT 解码器输出的 U0120Ġ空格符以及模型偶尔产生的functionname、paramname标签塌缩形式双路径解析优先用 XML 解析器lxml缺失时回退到标准库xml.etree.ElementTree失败后回退到正则function name...与param name...的 V1 兼容解析类型感知参数解析根据工具 schema 中声明的参数类型决定字符串直接透传还是 JSON/ast.literal_eval解析_get_argument_type_parse_arguments流式工具调用extract_tool_calls_streaming实现增量 delta 输出按块解析完整function.../function并对未闭合块做部分参数快照兼容 OpenAI streaming 语义。在 vLLM 中通过插件方式启用vllm serve openbmb/MiniCPM5-2B \ --served-model-name MiniCPM5-2B \ --dtype bfloat16 --max-model-len 131072 --port 8000 \ --enable-auto-tool-choice \ --tool-parser-plugin /path/to/MiniCPM/tool_parsers/minicpm5xml_tool_parser.py \ --tool-call-parser minicpm5等 vLLM 后续 release 内置 parser 后去掉--tool-parser-plugin只用--tool-call-parser minicpm5即可详见 docs/deployment/vllm.md。七、部署与微调 Cookbook 与 Agent SkillsMiniCPM5-2B 使用标准LlamaForCausalLM架构无需自定义算子也无模型代码 fork。仓库提供单页 cookbook 供手动执行并配套一一对应的 Agent Skills 供 Cursor / Claude Code 类 coding agent 使用。7.1 部署9 个后端后端模型格式 / 适用场景CookbookAgent SkillTransformersBF16 / FP16本地 Python 推理GPU CPUtransformers.mdminicpm5-deploy-transformersvLLMBF16 / FP16 OpenAI servervllm.mdminicpm5-deploy-vllmSGLangBF16 / FP16 OpenAI server推荐用于 tool callingsglang.mdminicpm5-deploy-sglangllama.cppGGUFCPU/GPU 本地推理llama_cpp.mdminicpm5-deploy-llama-cppOllamaGGUF本地端侧运行ollama.mdminicpm5-deploy-ollamaLM StudioGGUFMac 桌面应用与 OpenAI serverlmstudio.mdminicpm5-deploy-lmstudioMLXMLX / 4bitApple Silicon 本地推理mlx.mdminicpm5-deploy-mlxArcLightGGUF 本地端侧 / CPU / 桌面 / 服务器arclight.mdminicpm5-deploy-arclightLiteRT-LM.litertlm端侧运行时Android / iOS / 桌面 / IoTCPU GPUlitert.mdminicpm5-deploy-litertvLLM AscendBF16 / FP16 OpenAI servervllm_ascend.mdminicpm5-deploy-vllm-ascend7.2 微调5 个框架框架适用场景CookbookAgent SkillTRL PEFTLoRA / SFT 微调trl.mdminicpm5-finetune-trlLLaMA-Factory微调llamafactory.mdminicpm5-finetune-llamafactoryms-swift微调ms_swift.mdminicpm5-finetune-ms-swiftunsloth微调unsloth.mdminicpm5-finetune-unslothxtuner微调xtuner.mdminicpm5-finetune-xtuner7.3 Agent Skills 使用方式skills/minicpm5-deploy/SKILL.md 是部署入口路由 Skill其工作模式是先确认MODEL_PATHHF id 或本地路径、硬件NVIDIA GPU / Apple Silicon / CPU与目标交互对话 / OpenAI server / Python 脚本 / benchmark再依据决策矩阵精确选择一个后端子 Skill 并完整调用而非临场发挥。Skill 中特别记录了跨后端共性坑点部署前值得一读Think / No-thinkMiniCPM5-2B 仅支持 Think 模式temperature1.0, top_p0.95MiniCPM5-1B 额外支持 No-thinkenable_thinkingfalsetemperature0.7, top_p0.95128K 上下文max_position_embeddings131072、rope_theta5e6、无 rope-scaling需显式传--max-model-len 131072vLLM/--context-length 131072SGLang/-c 131072llama.cpp显存紧张时下调未绑定 lm_headtie_word_embeddingsfalse假设 Llama tied 默认的工具如旧版mlx_lm.convert会静默丢弃lm_head导致输出退化为随机 tokenMLX Skill 已内置修复。skills/minicpm5-finetune/SKILL.md 则是微调入口路由 Skill决策矩阵包括LLaMA-FactoryYAML / WebUI 驱动 SFT、ms-swiftChatML ModelScope 原生 SFT/DPO/KTO/ORPO、TRL PEFT裸 Pythonassistant-only loss、unsloth单卡 24GB 以内 LoRA/QLoRA、xtunermmengine 配置驱动。每个框架都有至少一个 MiniCPM5 特有坑点例如 LLaMA-Factory 必须用template: minicpm5需源码安装不能使用empty/llama3ms-swift 必须显式传--model_type llama --template chatml。微调产出的 PEFT adapter 若面向 GGUF 运行时llama.cpp / Ollama / LM Studio / 桌宠需先用minicpm5-finetune-gguf-loraSkill 转换为 GGUF LoRA。八、其他支持的框架FlagOS 多芯片部署除上述部署与微调框架外MiniCPM5-2B 也支持通过FlagOS进行多芯片部署。FlagOS 是北京智源研究院联合国内外科研机构、芯片企业、系统厂商等共同发起的开源社区致力于打造面向多种 AI 芯片的统一开源系统软件栈大型算子库、统一 AI 编译器、并行训推框架、统一通信库通过一次开发跨芯迁移降低迁移成本。基于 FlagOS 的多芯片统一软件栈MiniCPM5-2B 已适配Nvidia、Hygon、Metax、Iluvatar、Zhenwu、Mthreads、Kunlunxin、Ascend、ARM-v9等芯片平台各厂商版本已在 FlagRelease 平台发布下载表格见 README-cn.md。在 Nvidia 上体验 FlagOS 加速有两种方式从 FlagRelease 开始推荐平台已内置相关软件包无需用户安装从零开始要求 Python 3.12、GLIBC_2.39、GLIBCXX_3.4.33、CXXABI_1.3.15 环境。安装 FlagGems 算子库后在 vLLM 推理源码中导入并启用加速pip install flag-gems4.2.1rc0 pip install triton3.5.1import flag_gems flag_gems.enable(recordTrue, onceTrue, path/root/gems.txt)vllm serve ${model_path} \ --trust-remote-code \ --dtype bfloat16 \ --enforce-eager \ --port ${Port} \ --served-model-name ${model_name} \ --gpu-memory-utilization 0.85此外vllm-plugin-FL 是基于 FlagOS 统一多芯片后端为 vLLM 构建的插件可扩展 vLLM 在多种硬件环境下的功能与性能表现其示例目录中提供了 MiniCPM5-2B 的从零开始与从 FlagRelease 开始两种使用路径。九、MiniCPM5-1B系列首作与双模式推理MiniCPM5-1B 是 MiniCPM5 系列首个模型面向本地助手、coding agent、工具调用与紧凑推理场景同样达到同尺寸开源模型 SOTA 水平优势集中在 Agentic 工具调用、代码生成和高难推理并具备以下特性双模式推理内置thinkchat template通过enable_thinking在思考与非思考模式间切换同一份权重既可作为快速助手也可承担复杂推理训练流程与 2B 同构——base trainingstable decay→ mid-training → 后训练200B tokens deep-thinking SFT 200B tokens hybrid-thinking SFT → RL → OPD。RL 阶段组合推理基于 DAPO-Math-17k借鉴 JustRL 极简配方采用两阶段长度调度减少过长回复、闭卷问答TriviaQA / NQ-Open、写作、指令跟随LongWriter-Zero-RLData、长上下文理解与通用对话等多类互补信号OPD 阶段参考 Thinking Machines Lab 的 On-Policy Distillation 思路并结合 Rethinking On-Policy Distillation 做实现改进反向 KL 作为优势估计 双边 top-k 采样取并集。RL OPD 在数学、代码、指令跟随三类任务上将平均分提升 ↑16 分同时将回复触顶 max-tokens 预算的比例降低 ↓29 个百分点推荐采样参数Think 模式temperature0.9, top_p0.95enable_thinkingTrueNo Think 模式temperature0.7, top_p0.95enable_thinkingFalse桌宠同步发布 MiniCPM-Desk-Pet 桌宠应用通过轻量 llama.cppllama-serversidecar 加载 GGUF 模型向 Electron 桌宠 UI 提供 OpenAI 兼容本地接口支持 Apple Silicon / NVIDIA GPU / CPU 路线可与 Cursor、Claude Code、Codex 等编码 agent 联动并支持 LoRA 人格切换。MiniCPM5-1B 的部署vLLM / SGLang / Transformers命令与 MiniCPM5-2B 完全同构仅需替换模型 id 并采用对应采样参数完整代码示例见 README-cn.md 与 docs/deployment 系列文档。十、MiniCPM-SALA百万 token 上下文的混合注意力模型MiniCPM-SALA稀疏注意力与线性注意力是首个大规模稀疏 线性注意力混合模型原生支持百万 token 上下文2026-02 发布仓库内配套有独立文档 minicpm_sala/README.md 与 docs/MiniCPM_SALA.pdf。核心设计混合架构25% 层采用 InfLLM-V2 稀疏注意力长文本建模75% 层采用 Lightning Attention 线性注意力全局处理效率在消费级 GPU 上即可进行百万 token 推理Transformer 到混合架构的持续训练通过对预训练权重进行架构转换规避冷启动低效总训练预算降至从头训练的约 25%HyPE 混合位置编码协调长短上下文性能保持与 Qwen3-8B 等全注意力模型相近的通用能力推理效率A6000D 上 256K 序列推理速度达 Qwen3-8B 的 3.5 倍支持 1M 上下文推理而 Qwen3-8B 在此长度下 OOMTTFT 首字响应最高 2.5 倍加速长文本能力RULER 与 NoLiMa 所有长度范围最高 128K取得最高分训练长度 520K 时在 2048K 上下文下仍取得 81.6 分依赖稀疏注意力层的 NoPE 配置实现长度外推。推理时推荐Temperature0.9支持 HuggingFace 直接推理与 SGLang 专用分支minicpm_sala分支需编译 infllmv2_cuda_impl 与 sparse_kernel 等 CUDA 扩展并配合--attention-backend minicpm_flashinfer --dense-as-sparse等参数启动完整参数说明见 minicpm_sala/README.md。十一、MiniCPM4 与 MiniCPM4.1 系列可训练稀疏注意力 混合思考MiniCPM4 与 MiniCPM4.1 是面向端侧的 8B 级大语言模型从模型架构、学习算法、训练数据与推理系统四个层面进行效率优化高效模型架构InfLLM-V2 可训练稀疏注意力在 128K 长文本中每个词元仅需与不足 5% 的词元进行相关性计算高效学习算法模型风洞 2.0Predictable Scaling、BitCPM 三值量化90% 位宽压缩、FP8 低精度训练与多词元预测策略高质量训练数据UltraClean 清洗 / 合成策略开源 Ultra-FineWeb、UltraChat v2 多维度 SFT 数据高效推理系统CPM.cu 轻量 CUDA 推理框架融合稀疏注意力、量化与投机采样、ArkInfer 跨平台部署系统。推理模式MiniCPM4/MiniCPM4.1 支持稠密与稀疏两种推理模式。vLLM 与 SGLang 目前只支持稠密推理稀疏推理需使用 HuggingFace Transformers 与 CPM.cu。混合思考通过enable_thinkingTrue/False切换思考 / 非思考模式也可在查询末尾添加/no_think启用非思考、/think启用思考。长文本方面MiniCPM4 基于 32K 预训练、MiniCPM4.1 基于 64K 预训练均通过 YaRN 扩展到 128K 并保持大海捞针任务稳定表现MiniCPM4.1 还可通过调整config.json中rope_scaling的 LongRoPE 因子扩展到 131,072 tokens。InfLLM-V2 稀疏注意力配置启用需安装 infllmv2_cuda_impl 并在config.json中添加sparse_config字段关键参数包括参数默认值说明kernel_size32语义核的大小kernel_stride16相邻语义核的步长init_blocks1每个 query token 关注的初始块数量确保关注序列开头block_size64key-value blocks 的块大小window_size2048局部滑动窗口大小topk64每个 token 仅与最相关的 top-k 个 key-value blocks 计算注意力use_nopefalse是否在块选择中使用 NOPE 技术提升性能dense_len8192低于此 token 阈值自动切换为标准注意力短序列下稀疏收益有限设为-1强制始终稀疏推理与投机采样vLLM 与 SGLang 均支持基于 Eagle3 草稿模型的投机采样vLLM 侧需安装 EAGLE3 兼容分支并传入--speculative-configJSONSGLang 侧使用--speculative-algorithm EAGLE3 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 32。完整示例含 OpenAI 客户端代码、add_special_tokens注意事项见 README-cn.md 的 MiniCPM4/MiniCPM4.1 章节。微调方面支持 LLaMA-Factory。十二、开源协议与引用本仓库代码与 MiniCPM 模型权重依照 Apache-2.0 协议开源模型作为语言模型通过学习大量文本生成内容输出不代表开发者观点使用者应自行负责评估与验证本项目由面壁智能、清华大学自然语言处理实验室、人大高瓴人工智能学院共同开发引用请使用 MiniCPM4 论文arXiv:2506.07900BibTeX 条目见 README-cn.md 末尾。赞分享大模型本地部署模型量化微调LoRA工具调用openBMBAscend【免费下载链接】MiniCPMMiniCPM4 MiniCPM4.1: Ultra-Efficient LLMs on End Devices, achieving 3 generation speedup on reasoning tasks项目地址https://gitcode.com/OpenBMB/MiniCPM点击查看免费下载相关推荐DarkerVSCode提升Python代码质量的无缝开发体验配置DarkerVSCode提升Python代码质量的无缝开发体验配置 Darker是一款强大的Python代码格式化工具它能够智能地仅对Git仓库中自特定提大模型本地部署模型量化微调LoRA工具调用openBMBAscendMiniCPM5-2B 端侧部署实战ArcLight 从源码构建、GGUF 量化与 NUMA 多核 CPU 推理指南MiniCPM5 2B 端侧部署实战ArcLight 从源码构建、GGUF 量化与 NUMA 多核 CPU 推理指南 本篇指南面向需要在 统一内存架构uni大模型本地部署模型量化微调LoRA工具调用openBMBAscendMiniCPM5-1B 端侧大模型完全指南双模式推理、部署与微调实践MiniCPM 开源仓库详解MiniCPM5 1B 端侧大模型完全指南双模式推理、部署与微调实践MiniCPM 开源仓库详解 导读 本文以 MiniCPM 开源仓库主文档READM人工智能大模型基础模型本地部署微调模型量化openBMB上一篇【亲测免费】 探秘Venn.js优雅绘制面积比例的维恩图库下一篇在 tldraw 的 Tldraw 组件之外通过 React Context 使用 EditorExternal UIusing context实战指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考