Salesforce:让模型通过外推构造一个更远的目标 标题RISE: Recursive Improvement via Self-Extrapolating Policy Distillation来源arXiv, 2609.05295v1️文章简介研究问题在大语言模型自我改进训练中如何找到一个既不需要外部强大模型、又不依赖特权信息如正确答案的高质量“老师”来提供细粒度的逐词指导主要贡献提出了RISE方法通过 extrapolating外推模型自身的强化学习训练轨迹来合成一个“未来的自己”作为老师实现了无需外部模型的递归式自我提升。重点思路核心洞察现有的在线策略蒸馏OPD受限于老师的质量。外部老师存在分布不匹配而基于特权信息的自蒸馏受限于模型的上下文学习能力。作者认为模型正在收敛的“未来版本”是最佳老师。构建合成老师利用模型在RLVR可验证奖励的强化学习训练中的轨迹。计算当前检查点与之前锚点检查点在参数空间或Logit空间中的位移向量并通过系数β1进行线性外推从而合成一个代表“未来更强状态”的老师模型。双阶段互补训练循环第一阶段是RLVR通过稀疏的结果奖励确定改进的正确方向第二阶段是OPD将外推得到的“未来老师”的逐词分布蒸馏回当前模型提供细粒度的Token级监督。两种实现空间提供了权重空间外推类似任务算术需实例化参数和Logit空间外推几何混合输出分布无需额外参数存储两种变体并在实验中进行了对比。动态调整机制随着训练接近最优解安全的外推范围会变窄。因此RISE采用随时间递减的外推系数β并可选使用指数移动平均EMA作为锚点以平滑噪声。分析总结全面超越基线在数学推理、多领域STEM、代码生成和多轮智能体任务中RISE均显著优于仅使用RLVR的训练方法和现有的特权条件自蒸馏方法。样本效率更高RISE能在更少的训练步数内达到更高的准确率特别是在训练早期外推老师提供的密集信号加速了收敛。消融实验验证必要性去掉RLVR阶段会导致训练崩溃生成无限长文本证明外推方向必须由结果奖励 grounding去掉OPD阶段直接采用外推参数则几乎无增益证明逐词蒸馏是将方向转化为能力的关键。安全范围收缩实验证实随着模型性能提升允许的外推系数β的安全范围急剧缩小验证了使用递减调度策略的正确性。泛化能力保持RISE在提升特定领域能力的同时保持了甚至略微提升了分布外OOD任务的通用性能且扩大了正确解的覆盖范围passN提升。个人观点论文不再寻找外部更强的老师而是相信模型自身的进化趋势利用了强化学习中“方向正确但信号稀疏”和蒸馏中“信号密集但老师受限”的矛盾通过数学上的线性外推把稀疏的奖励信号转化为了密集的逐词指导。