VALVE:给 Agent 自我进化装一道“验收闸门“——从 1000 任务长跑到 75% 回撤削减 论文: Certified Long-Horizon Code Agent Evolution via Validation-Gated Skill Optimization作者: Yifan Wang (Purdue), Hao Cheng, Xiaomin Li, Yuexing Hao, Qianhui Wu, Wenlin Yao, Andrzej Banburski-Fahey, Baolin Peng, Jaron Lanier, Jianfeng Gao (Microsoft) 等 17 人机构: Purdue / UW / UC Davis / NYU / Cambridge / Microsoft ResearcharXiv: 2609.32990v1 [cs.AI], 2026-09-26一句话: 给 Agent 的"自我进化"装一道验证闸门(VALVE)——技能只有先通过留存任务对的 A/B 实测、拿到正边际收益才准入记忆库,从而在 1000+ 任务的演化长跑中把回撤砍掉 75%、把技能库压缩 11 倍,还附带了完整收敛性证明与"验收集要多大"的理论配方。看代码 Agent 自我进化,就像看视频编码器跑长 GOP:头几帧惊艳,跑着跑着参考帧全污染了,画质一路漂移。VALVE 做的事情本质上就是"参考帧管理"——不合格的帧,一律不许进 DPB。1. 介绍先说这篇文章解决的核心问题:权重冻结的 LLM Agent,能不能在长程部署中通过积累文本经验持续变强,而不是越跑越废?