腾讯:混合训练消除搜索对齐税 标题Cross-Domain Hybrid OPD for Generalizable Search Agents来源arXiv, 2608.02101v1️文章简介研究问题如何在提升大模型自主搜索能力的同时避免因强化学习导致的通用能力下降即对齐税主要贡献论文提出跨域混合在线策略蒸馏框架联合优化搜索专用强化学习与多领域专家蒸馏在保持搜索性能的同时恢复并增强通用智能。重点思路构建两阶段混合训练框架第一阶段仅针对代理搜索任务进行强化学习赋予模型自主规划、迭代检索和证据推理能力第二阶段引入多领域专家在线策略蒸馏联合优化搜索RL与通用能力。训练多领域专家教师模型分别针对数学、代码、逻辑推理和科学四个领域利用包含公开基准和内部合成数据的语料库采用基于信号密度的课程学习策略训练专家教师确保其具备鲁棒的领域专用推理能力。实施混合目标优化在第二阶段将搜索轨迹与通用领域样本混合成小批量数据。搜索样本继续使用GRPO算法优化通用样本则通过最小化学生模型与对应领域专家教师分布之间的反向KL散度进行蒸馏实现token级别的监督信号传递。设计结构化搜索环境代理通过XML风格协议调用网页、图像和视频搜索工具形成检索-执行-生成的闭环支持多跳信息获取和查询细化并通过规则验证器、执行沙箱和奖励模型提供准确的奖励信号。分析总结单一搜索强化学习存在对齐税实验显示仅在第一阶段优化搜索任务能显著提升多跳检索和长程交互等搜索基准的性能但导致数学、逻辑推理和代码等通用能力基准出现明显下降。混合训练有效缓解能力退化引入多领域专家在线策略蒸馏后模型在逻辑推理、代码生成和数学解题等通用基准上的性能大幅回升部分指标甚至超过基座模型成功抵消了搜索专用化带来的负面影响。搜索性能得以保留并增强在恢复通用能力的同时第二阶段的混合训练并未牺牲搜索性能多数搜索基准得分相比第一阶段仍有提升或保持高位证明蒸馏知识补充而非覆盖了已习得的搜索策略。组件消融证实关键作用移除在线策略蒸馏改用纯强化学习或合并多专家为单一大通才教师均会导致通用能力显著下降表明跨域多专家蒸馏和课程学习对高质量能力迁移至关重要。个人观点论文打破了搜索专业化与通用智能之间的零和博弈思维通过结合面向行为的强化学习与面向分布的知识蒸馏解决了垂直领域微调常见的灾难性遗忘问题。