35B 也配叫 Agent 模型?对“参数即实力“的一次清算 35B 也配叫 Agent 模型对参数即实力的一次清算【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini万亿参数曾是大模型世界最响亮的军备竞赛号角。从 GPT-3 的 1750 亿参数到各家旗舰动辄数百亿乃至上万亿的 MoE 架构一个隐形的等式被反复强化参数越多 能力越强 越配称为前沿模型。但 Agent 时代到来后这个等式开始出现裂缝。当评价维度从一句话回答得漂不漂亮转向能不能在一个真实环境里连续行动、调用工具、根据反馈自我纠错、最终把任务做完时模型的能力地图被彻底重绘了。本文要做的就是借 Nex-N2.5 家族中最小的成员——Nex-N2.5-mini总参数约 350 亿量级——对参数即实力进行一次基于证据的清算35B 到底配不配叫 Agent 模型Agent 任务的能力究竟来自哪里以及mini 档的定位哲学能给选型带来什么启发。参数即实力一条正在失效的旧叙事规模法则Scaling Law曾经是行业唯一的主旋律更多的参数、更多的数据、更多的算力带来更平滑的能力曲线。这种叙事在预训练阶段大体成立也因此在很长一段时间里参数量成为各家发布会最抢眼的营销数字。哪怕是 Nex-N2.5 家族自己也保留了完整的大中小梯度——README.md 中明确记载Nex-N2.5-Max 是建立在 1.6 万亿参数、纯文本 MoE 基座之上的模型需要双节点 16×H200 才能跑起来。但注意一个细节同在 README.md 中Nex-N2.5 的定位被写成built for long-horizon tasks in real-world environments为真实环境中的长程任务而构建而不是更大的模型。这个定位的转变本身就是行业风向的注脚。社区对 Nex-N2 系列的观察也印证了这一点该系列的优势集中在 SWE-Bench、Terminal-Bench 等 Agent 类基准上而在通用推理与深度工程任务中与头部模型仍有差距——换言之参数的含金量正在被任务类型重新定价。参数崇拜失灵的另一个佐证来自量化实践。Nex-N2-mini 的原始权重约 70.2GBmodel.safetensors.index.json 中 total_size 为 70,214,363,872 字节配合 config.json 的 bfloat16 精度对应约 350 亿参数而社区实测通过 mlx-optiq 的 3/6 位混合量化可将其压缩到约 17.8GB、峰值内存约 17.9GB、推理速度约 50 tokens/秒。参数规模在压缩前后的能力保真度远比参数数量这个静态数字更接近模型价值的真相——当然这取决于模型是否值得被压缩而 Agent 能力恰恰是量化后最容易被稀释的部分这就要说到 Agent 任务的真实瓶颈了。Agent 任务的真实瓶颈稳定、闭环、工具调用一个 Agent 模型的日常工作流是这样的接收任务 → 规划 → 调用工具执行命令、读写文件、搜索网页→ 接收环境反馈 → 修正计划 → 再次行动……如此循环直到任务完成。在这个循环里单轮答对一道题的静态能力几乎派不上用场真正决定成败的是三个东西长上下文下的稳定性、工具调用的格式纪律、以及闭环迭代中的自我纠错能力。35B 的含金量从哪来打开 config.jsonNex-N2.5-mini 的架构选择透露出它为 Agent 任务做的定向设计MoE 稀疏激活num_experts: 256、num_experts_per_tok: 8每 token 只激活 256 个专家中的 8 个配合共享专家shared_expert_intermediate_size: 512。这是35B 总量、低成本部署的技术底座——总量虽小但每层都在做定向专家路由而非全员前向。线性注意力与全注意力交替40 层文本层中layer_types清晰地呈现出3 层 linear_attention 1 层 full_attention的交替结构共 10 层全注意力、30 层线性注意力full_attention_interval: 4。在max_position_embeddings: 26214426 万上下文下这种混合注意力是控制 KV Cache 与算力成本的关键手段——长程 Agent 任务动辄积累数万 token 的工具调用记录与日志纯全注意力在 35B 量级根本扛不住。多 token 预测MTPmtp_num_hidden_layers: 1为推理加速与代码生成这类高吞吐场景服务。多模态感知闭环vision_config显示 27 层视觉编码器、patch size 16、temporal patch size 2配合 preprocessor_config.json 中 Qwen3VLProcessor 的长边 16M/短边 65K 像素上限——这不是为了看图聊天而是为了让模型能看电脑屏幕、验证操作结果即 README.md 所说的vision is no longer merely an input modality视觉不再只是输入模态而是 Agent 感知环境、验证结果的关键接口。这些设计组合在一起构成了一台为行动而非回答优化的引擎。工具调用的格式纪律从模板到运行时Agent 能力的另一个关键在格式纪律——模型输出的工具调用必须机器可解析否则整个闭环在第一环就断裂。chat_template.jinja 把这个纪律写进了模板层工具调用使用严格的 XML 结构tool_callfunction名称parameter参数名值/parameter/function/tool_call模板甚至要求函数调用之前可以有自然语言推理但之后不允许以约束输出格式工具结果统一包裹在tool_response标签中回填对话模板用multi_step_tool逻辑在消息序列中定位真正的用户查询跳过工具响应保证多轮工具循环时角色边界不混乱思考过程用think标签包裹reasoning_effort三档控制思考强度none直答、medium自适应思考、high总是思考README.md 中的部署命令进一步把--tool-call-parser qwen3_coder与--reasoning-parser qwen3作为标准配置——思考轨迹与最终回答、工具调用在运行时被拆分成不同流而不是糊成一团。换句话说这个 35B 模型从模板到推理引擎每一步都在为一个词服务可闭环。这与社区对 Nex 系列的判断一致——它的模型能力依赖定制 SGLang 框架、推理解析器与调度策略强调的是真实任务稳定性而非单轮回答质量。用数据说话在 Agent 赛道上35B 能赢谁空谈架构没有说服力README.md 的基准表给出了可以对照的硬数据。下表列出 Nex-N2.5-mini 与家族内更大成员及外部头部模型的部分成绩基准Nex-N2.5-miniNex-N2.5-ProNex-N2.5-MaxClaude Opus 5GPT-5.6 SolTerminal-Bench 2.1终端操作73.482.786.189.188.8SWE-Bench Pro软件工程43.861.265.779.264.6Toolathlon Verified工具调用54.668.574.776.574.9BrowseComp浏览检索83.489.792.690.890.4OSWorld-G电脑操作82.987.4—76.877.7Job Bench工作自动化28.541.453.665.745.4粗体为该项最佳数据来源见 README.md 的评测说明采样参数为 temperature 0.7 / top_p 0.95 / top_k 40。读这张表需要双重眼光一方面35B 在 Agent 类任务上的表现确实反参数直觉。OSWorld-G 上Nex-N2.5-mini 以 82.9 分超过 Claude Opus 5 的 76.8 与 GPT-5.6 Sol 的 77.7——这是更小的模型在操作真实电脑这类长程闭环任务上正面击败更大对手的罕见案例。BrowseComp 83.4、Toolathlon 54.6、Terminal-Bench 73.4也都处于一个有竞争力的区间。社区对 Nex-N2-mini 的评价——在 BrowseComp、SWE-Bench 等基准中表现优异——有数据支撑。另一方面这张表也是一次诚实的清算。同样来自 README.mdSWE-Bench Pro 43.8 对 79.2、Job Bench 28.5 对 65.7多模态侧 SWE-MM 25.5 对 59.4——在需要深度工程推理与通用理解的赛道上mini 与万亿级选手的差距是实打实的。社区评论在通用推理与深度工程任务中仍有差距并非客套而是这张表的注脚。结论因此是清晰的Nex-N2.5-mini 的强项不是什么都会一点而是在 Agent 工作流所要求的稳定、闭环、工具调用维度上以 35B 的总量打出了超出规模的成绩。参数规模在这些任务上不再是首要变量训练目标、架构设计与运行时的配合才是。mini 档的定位哲学够用且可控如果说上面的数据回答了配不配那么剩下的问题就是为什么要有 mini。README.md 给出的部署矩阵本身就构成一张定位图Nex-N2.5-Max双节点 16×H200面向文本推理极值Nex-N2.5-Pro单节点 8×H100多模态电脑操作主力Nex-N2.5-mini单节点2×H100TP2 即可起服务。35B 的意义在于它把Agent 能力的准入门槛从一个机柜降到了两张卡。社区实践进一步把这个门槛往下压GGUF 量化 MNN 框架的安卓端落地、Q4_K_M 量化下的端侧推理对比、MLX 3/6 位混合量化到 17.8GB 的 Apple Silicon 部署——这些围绕 Nex-N2-mini/N2.5-mini 展开的社区工程本质上都是在论证同一个命题当模型能力不再与参数规模强绑定端侧与边缘场景才第一次配得上Agent这个头衔。这种够用且可控的定位哲学与社区总结的 Nex 系列技术画像完全吻合bfloat16 精度、模块化 safetensors 结构、Hugging Face / SGLang 生态兼容、低技术债务与短部署周期。它放弃了全能的叙事换取了可复现、可微调、可下沉的工程现实——对一个开源模型来说后者往往比一个虚高的跑分更有价值。结论把参数从 Agent 模型的 KPI 里拿掉回到标题的问题35B 配不配叫 Agent 模型答案是在 Agent 任务的坐标系里配在通用深度推理的坐标系里不配。而配不配这件事本身恰恰证明了参数规模不是衡量 Agent 模型的正确刻度。Nex-N2.5-mini 用 35B 的总量、每 token 仅激活 8/256 专家的稀疏架构、1030 的混合注意力、严苛的工具调用模板与三档思考控制在 OSWorld-G、BrowseComp、Toolathlon 这类长程闭环任务上交出了接近甚至超过更大模型的成绩同时它也大方地把 SWE-Bench Pro 43.8 这样的短板摆在了同一张表上。这种定向强 坦诚弱的姿态比任何全面碾压的宣传都更接近工程现实。对从业者而言真正的收获不是该不该买 35B而是一套新的选型思维先问任务是不是长程、闭环、工具密集的 Agent 场景再问自己的算力与部署边界最后才轮到参数规模。当 Agent 成为大模型的主战场参数即实力的旧叙事是时候让位给闭环即实力、稳定即实力、单位算力产出即实力了。而一个 35B 的模型恰好就是这场清算最好的证人。【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考