RAG中30个结果全涨,CorVer只查语料就起飞了

发布时间:2026/7/22 2:46:13
RAG中30个结果全涨,CorVer只查语料就起飞了 数学推理可以调用计算器检查答案代码生成可以通过编译器和单元测试获得确定性反馈。但在事实问答中一段回答可能同时包含正确和错误陈述我们却很难为每句话提供低成本、可扩展的训练奖励。只检查最终答案监督信号过于粗糙逐句调用 NLI 模型、LLM judge 或知识验证管线又会在强化学习的大量 rollout 中形成巨大的计算瓶颈。CorVer 提出了一条不同路线不让另一个神经模型判断事实而是直接查询语料中的实体共现统计。图 1数学和代码拥有低成本程序化验证CorVer 为事实问答提供基于语料索引的句子级信号。把 Wikipedia 共现次数变成过程奖励CorVer 会把模型回答拆分成句子并对每句话执行三个步骤使用一个 0.5B 参数的轻量模型抽取第一个有效的主语—宾语实体对将实体保留为内容词并向 Infini-gram 构建的 Wikipedia 索引提交一次 AND 查询根据共现次数所属区间将该句映射为有界的正向或负向奖励。句子奖励随后通过 token-to-sentence 对齐分配到对应 token再与最终答案正确性奖励和格式奖励结合用于 GRPO 更新。因此同一条回答中的正确句子和错误句子可以获得方向相反的局部梯度而不是被一个统一的最终得分一起奖励或惩罚。整个过程每句话只需要一次 0.5B 抽取器前向计算和一次索引查询不需要在奖励循环中调用大型神经验证器推理阶段也不会增加任何成本。共现真的能代表正确性吗共现不是完整的事实核验因此首先要确认它是否至少提供方向可靠的训练信号。论文对 700 个人工标注句子进行校准分析发现句子正确率会随共现次数单调增加当共现次数为 0 时句子正确率约为 **23%**当共现次数达到 20 次及以上时正确率上升至 **81%**。图 2Wikipedia 共现次数与人工标注正确率呈单调关系为分段奖励提供了经验依据。这种信号并不声称“共现即事实”而是利用大规模语料统计给策略优化提供一个低成本、方向稳定的局部提示。六个模型、五个基准30 个结果全部提升CorVer 在六个 3B–14B 的指令模型和五个事实问答基准上进行评估共形成 30 个“模型 × 数据集”组合。相较原始模型30 个组合全部获得正向提升TriviaQA 平均提高4.1 个百分点。图 3CorVer 相较原始模型的准确率增益每个单元格均为正值。在可实际运行的配置下CorVer 还在 20 个对比单元格中的18 个超过 FoRAG、RLFH、FSPO 和 KnowRL 等神经验证器基线。以 Llama-3.1-8B 为例五个基准的平均准确率从 30.64% 提升到 35.27%在 NQ-Open 上从 40.66% 提升到 48.34%。消融实验表明提升不仅来自增加了一项奖励更来自奖励被分配到正确的句子和 token。把相同共现奖励压缩成一个回答级标量后效果显著下降句子级对齐是 CorVer 的关键组成部分。更密集的奖励反而更便宜一次典型训练大约会触发 (1.2 \times 10^5) 次句子级奖励计算。在这一规模下每次验证都调用神经模型会迅速成为主要成本。CorVer 在四个基础模型上的平均训练时间为3.2 小时而四个基线平均需要 14.5–29.5 小时相当于慢4.8–8.4 倍。图 4语料索引使 CorVer 能够在保持句子级密集监督的同时显著降低训练时间。低成本代理信号的边界CorVer 的优势来自简单也因此有清晰局限。它只抽取主语和宾语不理解谓词语义两个实体即使高频共现句子中的关系仍可能是错误的。信号也受索引语料覆盖限制PopQA 分析显示收益更倾向于出现在 Wikipedia 统计较充分的实体上而不是最稀有实体上。一句话总结CorVer 用“语料中是否有支持痕迹”替代“再调用一个大模型来判断”为事实问答提供了可在强化学习规模下使用的低成本句子级奖励。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】