微调后模型输出千篇一律怎么办?CreativeInstruct 创造力标记法与 GRPO 增益解读 【技术解读】本文深度解析北卡罗来纳大学教堂山分校UNC Chapel Hill提出的 CreativeInstructarXiv:2608.07460它不做全局温度调节而是把测试期的双模型 token 级路由离线「编译」进单模型权重。三步流程——① 用 BACo 的 probpunc 变体对 Tülu V3 中筛出的 4,000 条英文写作提示逐 token 路由生成每提示采 3 个输出共 12,000 条样本并记录每个 token 来自基座还是对齐模型② 把连续来自基座的 span以及两模型概率差 ≤0.005 的无分歧片段用 [StartCreativity] / [EndCreativity] 两个特殊标记显式包围把「此处该发散」的路由决策写进训练序列③ 用 LoRAr32、α64、dropout 0.05覆盖全部注意力与 MLP 投影层微调对齐模型使其推理时自主注入标记并切换风格不再需要基座模型常驻陪跑。评测侧提出 LLM-GED把故事抽象成实体/事件有向图后计算归一化图编辑距离与人工叙事多样性排序相关系数 0.889远高于 Distinct-n 与嵌入距离。结果Llama-3.1 8B 的 LLM-GED 0.366→0.545、Cos-D(M) 0.309→0.458、写作质量 WQRM 5.93→6.65跨五个模型家族平均单模型方案比双模型 BACo 语义多样性高约 29%、结构多样性高约 28%。强化学习侧Qwen3 8B 上同配置 GRPO 在 CreativeInstruct 检查点比在标准对齐检查点多涨 5 个点MATH 0.409→0.459与 4 个点AMC 0.438→0.478。消融显示训练数据在 12,000 条时仍未饱和且通用指令数据0.5451显著优于 2,020 条叙事领域内数据0.3341。后训练在换取听话的同时付出了多样性代价做过指令微调和 RLHF 的团队大多有过一个共同体验模型变得更听话、更规范、更少胡说八道但同时也变得越来越没意思。同一个提示采样十次十次的开头几乎一模一样人名永远是 Elara 或 Lyra故事结构永远是三段式。这个现象在文献里被称为多样性坍缩diversity collapse它不只影响创意写作这类显式需要创造力的任务——对强化学习来说它是更隐蔽也更致命的问题GRPO、PPO 这类在策略算法要靠 rollout 之间的差异来构造优势信号如果一组 rollout 高度雷同梯度信号就近乎消失。2026 年 8 月 7 日北卡罗来纳大学教堂山分校UNC Chapel Hill的 Ananya Sahu、Mohit Bansal 与 Elias Stengel-Eskin 在 arXiv 提交了论文 CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and DiversityarXiv:2608.07460。这篇工作的立意与一般提升创造力的研究不同它不试图把模型整体推向更发散而是让同一个模型学会在什么位置该发散、什么位置该收敛把创造性生成变成一种可局部触发的能力而不是全局的温度调节。核心方法把测试期路由编译进模型权重要理解 CreativeInstruct得先理解它想替代的东西。此前提升多样性的一条有效路线是测试期双模型路由论文中以 BACo 为代表同时加载基座模型和对齐模型逐 token 决定用谁的分布——标点和格式类 token 交给对齐模型保证规范高熵位置交给基座模型引入变化。效果不错但代价是推理时要常驻两个模型显存和延迟都翻倍工程上很难上线。CreativeInstruct 的思路是把这套运行时行为离线蒸馏成单模型的一个可学习信号。具体流程分三步第一步用路由生成带来源标注的数据。团队从 Tülu V3 SFT 数据集中筛出 4,000 条英文写作类提示用 BACo 的 probpunc 变体逐 token 路由生成每条提示采 3 个输出共 12,000 条训练样本。生成过程中记录每个 token 究竟来自基座还是对齐模型。第二步把连续的基座 token 片段包成显式标记。凡是连续来自基座模型的 span用[StartCreativity]和[EndCreativity]两个特殊标记包围此外基座与对齐模型概率差在 0.005 以内的片段即两者本来就无分歧的位置也一并包上。这一步是整个方法的关键——它把这里应该更发散这个原本隐含在路由器里的决策显式写进了训练序列。第三步用 LoRA 微调对齐模型学会自主注入标记。配置为 r32、α64、dropout 0.05覆盖全部注意力与 MLP 投影层。训练完成后模型在推理时自行决定在哪里插入标记并切换风格不再需要基座模型在线陪跑。论文另一项方法贡献是评测指标。词汇级Distinct-n和语义级嵌入余弦距离指标都测不出叙事结构层面的雷同——换几个人名、改几个形容词就能把分数刷上去但故事骨架依然一样。团队提出LLM-GED让大模型把每篇故事抽象成有向事件图节点是实体和事件实体统一规范化为 Character1、Location1 这类抽象标识符边是 agent、affected、causes 等语义关系与 next_event 时序关系再计算两两之间的归一化图编辑距离 nGED GED / max(|G_A|, |G_B|)。验证显示 LLM-GED 与人工叙事多样性排序的相关系数达0.889显著高于所有词汇和语义指标与确定性图构建流水线相比均值差仅 -0.012p0.56统计上等价但成本低得多。实验数据多样性涨了质量没掉RL 还额外受益论文在 Llama-3.1 8B、Qwen2.5 7B/32B、Qwen3 8B/32B 五个模型上做了验证。以 Llama-3.1 8B 为例结构多样性 LLM-GED 从对齐基线的 0.366 提升到0.545语义多样性 Cos-D(M) 从 0.309 提升到0.458均超过 BACo 双模型路由0.374 / 0.255和无标记的普通蒸馏 Distill0.523 / 0.444。跨模型家族平均下来单模型的 CreativeInstruct 相比双模型 BACo 在语义多样性上高约 29%、结构多样性上高约 28%。质量方面没有出现常见的此消彼长。Llama-3.1 8B 的写作质量奖励模型分 WQRM 从 5.93 升到6.65Qwen3 8B 从 6.56 升到6.90连贯性和流畅度的 Likert 分与对齐基线基本持平3.55 vs 3.69、4.22 vs 4.09。作为对照去掉创造力标记的 Distill 在多个家族上质量明显滑落——Qwen2.5 7B 的连贯性掉到 2.98Qwen3 8B 掉到 2.38。这说明标记不只是提多样性的开关也起到了隔离作用把发散行为限制在被标记的片段内避免污染全局质量。人工评测用 GPT-5 生成 50 个主题3 名 NLP 背景标注者做匿名成对比较。创造力维度上 CreativeInstruct 以70.3% 对 29.7%胜出二项检验显著Cohen’s κ0.720一致性较高多样性维度 57.4% 对 42.6%κ0.417一致性中等这一项的结论强度弱于创造力项。最值得关注的是强化学习那组实验。在 Qwen3 8B 上跑 GRPO训练 1000 步、8 rollouts、上下文 2048、MATH 12k 训练集、3 个随机种子取平均检查点MATHAMCInstruct 基线0.3740.432Instruct GRPO0.4090.438CreativeInstruct 基线0.4240.428CreativeInstruct GRPO0.4590.478同样的 GRPO 配置在 CreativeInstruct 检查点上比在标准对齐检查点上多涨了 5 个百分点MATH和 4 个百分点AMC。有意思的是CreativeInstruct 检查点在 RL 之前的 AMC 分数0.428其实还略低于对齐基线0.432——它的价值不在于起点更高而在于给 RL 提供了更好的探索基底。这也从侧面印证了多样性坍缩确实在压制在策略算法的天花板。消融部分还有两条对落地有直接参考价值的结论。一是数据量尚未饱和训练样本从 1,000 增到 12,000LLM-GED 从 0.3824 一路涨到 0.5451曲线没有走平。二是通用指令数据比领域内数据更管用用 2,020 条叙事领域内数据训练LLM-GED 只有 0.3341远低于用 12,000 条通用 Tülu 数据的 0.5451。实体重复率的对比也很直观——专有名词唯一率在提示组内从对齐基线的 18.1% 提升到 37.1%全语料范围从 12.0% 提升到 24.7%。需要说明适用边界论文的多样性主实验集中在叙事生成任务RL 增益只在 Qwen3 8B 的数学任务上验证过一组配置是否能推广到代码、Agent、长程规划等场景还没有证据。另外方法依赖基座模型可获取——Qwen3 32B 因为没有公开 base只能借 Qwen2.5 32B 生成数据做迁移这在纯闭源基座的场景下不成立。商业启示多样性应当成为微调交付的一项显式指标对思陌大模型微调的客户项目来说这篇论文提示了一个容易被忽视的验收维度。指令对齐环节需要引入多样性守恒目标。我们在做 SFT 与 RLHF/DPO 对齐时验收指标通常集中在准确率、指令遵循度、拒答率上很少有人量化输出还剩多少变化。但在文案生成、对话、方案撰写这类交付场景中客户抱怨AI 味太重“几次生成都一个模子往往就是多样性坍缩的直接后果。CreativeInstruct 提供的是一条低侵入路径一个 r32 的 LoRA、一万余条训练样本不改推理架构、不加常驻显存把发散能力做成可控开关。评估优化环节需要补上结构层面的多样性度量。现有评测体系里的 Distinct-n 和嵌入距离都测不到叙事或论证骨架的雷同度LLM-GED 这类图编辑距离指标可以纳入我们的评估工具箱作为交付前的质量门禁之一。它对人工判断的相关性达 0.889而且可以用大模型批量算成本可控。RL 微调项目应把探索基底当作前置工序。越来越多客户希望用 GRPO 做垂直领域的推理能力优化实践中最常见的卡点就是训练几百步后奖励曲线走平——很大程度上是 rollout 同质化导致优势信号消失。这篇论文给出的证据是先花一小笔成本恢复检查点的生成多样性再启动 RL同样的算力预算能多拿 4–5 个点。这个顺序对项目排期和成本核算有实际意义。数据工程环节则要重新审视领域内数据更好的直觉。消融实验显示通用指令数据在多样性维度上明显优于领域内小数据集这与我们做领域适配时数据越贴近业务越好的常规经验形成张力。合理的解读是任务能力靠领域数据生成风格的丰富度靠通用数据两者在数据配比上应当分开考虑而不是一味压缩通用语料的占比。参考文献Sahu, A., Bansal, M., Stengel-Eskin, E. (2026). CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity. arXiv: 2608.07460 | DOI: 10.48550/arXiv.2608.07460论文开源代码仓库github.com/ananya-sahu/CreativeInstruct本文为思陌大模型微调团队对公开论文的独立解读数据与结论均以原文为准不代表原作者观点。论文原文信息链接微调后模型输出千篇一律怎么办CreativeInstruct 创造力标记法与 GRPO 增益解读注本文由 AI 辅助生成仅对论文做独立解读不代表原文作者观点。