
AI 学会「自己找教练」NeoHorse RSI 双环首次跑通全网都在聊【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B9 月上旬一家名为基元律动TokenRhythm的创业公司联合无问芯穹与清华大学、北京大学、阿里巴巴等机构共同发布首个 Agent-Native 模型 NeoHorse-1。相比又发布了一个 9B 模型这种常规叙事真正让社区炸开锅的是它的技术路线官方技术报告把标题写成了Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness——一匹会自己找教练的马用一套路由驾驶舱Routing Harness把自己的执行轨迹变成下一次进化的燃料。媒体用RSI 双环首次跑通来形容这次发布不是又卷了一轮榜单而是第一次把评价—选择—更新的闭环在真实模型权重上完整转起来。本文结合仓库源码与公开技术报告拆解这套实验到底讲了什么、为什么被当成里程碑以及开源权重把自我提升带到了哪一步。会找教练的马RSI 递归自我提升实验讲了什么递归自我提升Recursive Self-ImprovementRSI是 AI 领域被讨论多年的终极命题模型能否利用自身运行产生的信号持续改进自己的能力而非永远依赖人类标注数据。过去几年这个方向的公开进展大多停留在推理时扩展test-time scaling、自我对弈self-play等局部环节真正把改进写回权重、形成循环的系统性尝试凤毛麟角。NeoHorse 实验的切入点很特别——它不要求模型自己当自己的教练而是把教练放在模型外面一套开源的路由驾驶舱 OpenSquilla。这套系统在 Agent 执行任务时负责能力需求预测、模型路由选择与调度相当于一个经纪人或教练知道每类任务该派哪个模型上场。NeoHorse 的洞见在于这些路由与执行过程天然沉淀下高价值训练数据。正如技术报告所述训练语料以 OpenSquilla 等 Routing Harness 产生的执行轨迹为核心每条轨迹完整保留了五个关键环节能力需求预测、路由选择、模型响应、工具调用和环境反馈再辅以公开数据。这与传统 SFT 数据问题标准答案有本质区别——它记录的是模型在真实工具环境中如何行动、如何出错、如何恢复。这批轨迹不是拿来即用的。在写入训练集之前它们要过一遍质量漏斗完整性检查剔除中断的执行目标完成度判断任务是否真正收尾证据一致性核对回答是否与观察到的环境状态相符错误恢复能力评估模型能否从失败中回正。仓库 README.md 的 Highlights 把数据治理总结为精确与近似重复去除、评测污染去除、结构化校验、六维语义评估以及子场景级别的 Scene/Goal/Outcome 标注。换句话说喂养 NeoHorse 的不再是题库而是病历——完整的症状、决策、用药与转归。有了这批带反馈的轨迹训练环节采用路由引导的 Agentic 后训练框架路由引导课程式 SFTrouting-guided curriculum SFT与路由引导在线蒸馏routing-guided on-policy distillation。课程式安排的细节在媒体报道中亦有印证路由器会估计任务所需能力并形成不同能力档位的信号训练时据此安排样本顺序——先学能力需求低的样本再逐步上难度。这相当于教练不仅记录了比赛录像还按先易后难的节奏给选手编排了训练课表。双环首次跑通这为什么被当成里程碑RSI 双环首次跑通这一说法出自本次发布的多篇媒体报道标题。所谓双环可以从 README.md 对 RSI 路径的定义中还原路由驾驶舱把任务分配给异构模型池记录工具交互与执行结果估计能力需求并以能力级别的反馈塑造下一轮训练数据配比更新后的模型重新回到驾驶舱服役从而闭合一个评价—选择—更新evaluation–selection–update的循环。拆开看这是两个嵌套的环内环单次闭环执行产生轨迹 → 轨迹被质量评估 → 成为训练信号 → 模型更新 → 新模型回到 harness 继续执行。NeoHorse-1 是这条环路的第一个可运行原型本次发布即宣告内环首次跑通。外环跨代际递归把上述循环跨多轮迭代重复执行让每一代模型都基于上一代的真实表现持续改进——这才是 RSI 的完整形态也是官方明确定义的下一步。为什么内环跑通本身值得被当成里程碑因为在它之前自我提升大多停留在论文提案或框架演示层面要么只验证了数据回路而不更新权重要么只做了权重更新但训练数据与真实部署环境脱节。NeoHorse-1 第一次把真实执行环境harness 调度→ 反馈 → 权重更新 → 回归环境完整走通并落地为可下载、可复测的开源权重。技术报告给出明确论断这是一个 feedback-driven process 的初始原型是一条通往 harness 中介的 RSI 路径。对社区而言这相当于第一次看到马自己跑去找教练、教练把它练强、它再上场跑的完整录像而不只是教练的一页教案。从实验到开源NeoHorse 把自我提升带进真实模型实验叙事再漂亮最终都要落到权重上接受检验。仓库中的 NeoHorse-1-9B 是这一路径的 9B 版本一个从 Qwen3.5-9B 后训练而来的因果语言模型Apache-2.0 协议开源面向文本型 Agent harness、工具调用、编码与指令遵循场景。先看评测结果。README 的评测章节将 NeoHorse-1-9B 与 Granite-4.2-8B、Qwen3.5-9B、Ornith-1.5-9B、Gemma-4-12B-it、Muse-Glimmer-30B 五个开源基线对比覆盖十项基准总体十项平均 69.04对比底座 Qwen3.5-9B 的 65.60提升 3.44也是六个模型中唯一突破 69 分的选手Agentic 能力tau²-Bench 90.822.78全场第一、QwenClawBench 48.734.69全场第一、PinchBench 82.257.70全场第一、VitaBench 42.2511.00、BFCL v4 67.432.55全场第一、WorkBuddy Bench 40.150.55CodingHumanEval 98.175.49、LiveCodeBench v6 65.14持平底座指令遵循IFBench 66.33、IFEval 89.09-0.37。值得注意的是最大的涨幅集中在 Agentic 类目VitaBench 11.0、PinchBench 7.7、QwenClawBench 4.7——这正是以执行轨迹训练这一路线的直接收益模型学的是如何与环境、工具和反馈打交道而不是背题。README 同时披露了报告的评测协议SGLang v0.5.17temperature1.0、top_p0.95、top_k20开启 thinking 模式并强制非空推理内容QwenClawBench、WorkBuddy Bench、tau²-Bench 各跑三轮取均值。协议完整公开意味着任何人都能复测——这也是跑通二字的含金量所在。再落到工程层面。这个 9B 模型并非简单套壳config.json 展示了几个值得注意的架构细节混合注意力设计32 层中layer_types明确标注了 8 个full_attention每 4 层插入一个full_attention_interval: 4与 24 个linear_attention交错排布。线性注意力层带有conv1d、dt_bias、A_log等状态空间类参数linear_conv_kernel_dim: 4说明这是标准注意力与线性注意力混合的架构在长上下文与推理成本之间做工程取舍超长上下文max_position_embeddings为 262,14426 万 tokenREADME 注明原生支持且可扩展至 1,010,000 token——对 Agent 多轮工具调用场景而言长上下文是硬需求原生 MTPmtp_num_hidden_layers: 1保留了多 token 预测头纯文本重打包模型卡明确说明本发布仅含语言模型权重Safetensors/BF16针对纯文本推理重打包视觉权重未包含且重打包不改变微调后的张量数值。model.safetensors.index.json 中的权重映射印证了这一点embedding、linear_attn 与 self_attn 按层分片存放于四个权重文件中总大小约 17.9GB。作为 Agent-Native 模型与工具交互的原生支持也体现在 chat_template.jinja 中模板内置了tool_callfunction...parameter...的 XML 风格工具调用协议以及tool_response回合结构还处理了 think 块与多步工具调用的排列——这是为模型在 harness 里真实干活量身定制的对话协议而非通用聊天模板的简单改写。部署层面README 给出了两条主流路径SGLang与官方技术报告同版本 v0.5.17与 vLLM均以--reasoning-parser qwen3、--tool-call-parser qwen3_coder启动暴露 OpenAI 兼容接口。例如python3 -m sglang.launch_server \ --model-path $MODEL_PATH \ --served-model-name neohorse-1-9b \ --host 0.0.0.0 --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder社区对这一开源动作的反馈也相当热烈。知乎与 CSDN 的解读文章在发布后数日内密集涌现标题多聚焦9B 均分 69.04、超底座 3.44 分以及首个 Agent-Native 模型的定位澎湃新闻、上观新闻等主流媒体则把重点放在产业层面——两家上海企业基元律动与无问芯穹联手让 Agent 走进核心业务而创办人王云鹤前华为诺亚方舟实验室主任、盘古大模型负责人创业后的首个模型也由此正式亮相。开源社区则迅速跟进了 GGUF 量化版与 llama.cpp/vLLM 部署教程把自我提升实验变成了可上手把玩的日常工具。当然冷静审视之下这仍是原型而非终局十项平均 69.04 的领先主要来自 Agentic 类目Coding 与指令遵循相对底座提升有限甚至持平而 RSI 的外环——跨多代迭代的递归改进——官方也明确留作下一步。换句话说双环首次跑通的意义在于证明了执行环境反馈→权重更新的循环可以真实转起来但一匹会自己找教练的马才刚刚开始第一圈。对开发者而言这恰好是参与的最佳时机Apache-2.0 许可、完整公开的评测协议、双框架部署支持意味着任何人都可以把这匹马牵回自家场地验证它是否真的越跑越快。【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考