Miles Chat Template系统详解:Rollout与训练间模板差异如何处理 Miles Chat Template系统详解Rollout与训练间模板差异如何处理【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/milesMiles 是一个面向企业级的 LLM/VLM 后训练强化学习框架与 slime 共同演化。本文带你深入 Miles 的Chat Template对话模板系统在多轮 Agent Rollout 中推理端SGLang与训练端各自渲染对话模板一旦两边 token 不一致就会产生 train-infer mismatch、奖励信号失真。Miles 通过TITOToken-In-Token-Out会话机制 固定模板Fixed Template 模型族边界令牌处理三层设计保证 Rollout 记录的训练样本与模板输出在 token 级严格一致。一、为什么 Chat Template 是 RL 训练的隐形变量在多轮 Agentic Rollout 中对话是增量追加的模型生成一轮回答后环境追加tool/user消息再请求下一轮。问题在于——很多模型的官方模板不是 append-only 的追加一条新的user消息后模板会重新分类历史 assistant 轮次悄悄删掉之前的think思考块如 Kimi K2.5、DeepSeek-V3.2 的原生行为模板输出的结尾令牌与模型实际停止位置不一致如 Qwen3 停在 【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考