生成式AI之父:自进化Agent系统全面复盘

发布时间:2026/7/21 23:12:14
生成式AI之父:自进化Agent系统全面复盘 今天分享LSTM 之父和生成式 AI 之父Jürgen Schmidhuber署名的最新论文「自我进化Agent」全景综述。自我改进Self-Improvement从哲学畅想变成了工程热点——Reflexion、Voyager、Darwin Gödel Machine、GEPA、SkillOpt……新工作几乎每周都在冒但术语极度碎片化self-correction、meta-prompting、self-play说的其实是同一族机制。没想到DeepSeek-V4和Kimi-K2论文里还藏着一家国产模型公司Figure 1自我改进范式总览——基座模型改进θ与脚手架改进Σ两条主路径这篇97页综述的价值在于它用一个统一的形式化框架把2023–2026年200多个工作收纳进同一张地图还把概念根脉一路追溯到1790年代的最小二乘法。Figure 4自1790年代末至今的理论根源与理想模型时间线核心定义Agent (θ, Σ)一个公式定江山综述的第一块基石是给出现代agent的系统级抽象。在时刻 tA_t (θ_t, Σ_t)其中 Σ_t (p_t, m_t, T_t, g_t)Figure 5形式化框架下的FM-based Agent结构示意图θ基座模型的神经参数认知核心Σ操作脚手架operational scaffold——即最近业界热议的harness论文特意说明用 scaffold 强调可修改的结构pprompt/系统指令m记忆机制及其检索更新策略T工具集与调用接口g控制逻辑路由、调度、安全约束Figure 22023–2026代表性工作时间线左道θ右道Σ终点指向AGI路标还有一个对工程界极有价值的定义——Skill 自诱导更新算子 U 的可复用序列化实例。Skill的本体是那次更新本身存在哪个基板只是存储位置。并且区分 object-level skill与 meta-level skill——后者才是自我改进的核心。DeepSeek和Kimi之后又一家中国企业出手了分类框架两条进化路径一个信号视角在 A(θ,Σ) 之上综述提出统一分类法先按改什么分两条主路径再按信号从哪来细分Table 1与相关综述的组织维度对比路径更新对象特点类比基座模型改进θ参数空间慢、贵、稳定全局、难回滚、可跨任务摊销System 1长期巩固脚手架改进Σ执行空间快、便宜、可逆、任务特定、无灾难性遗忘System 2快速试错与已有综述Gao et al. 2026、Fang et al. 2025、Tao et al. 2024相比本篇的独特性在于信号视角signal lens 更新基板update substrate双轴正交并且把FM微调和agent脚手架放进同一个形式化里而不是当作两个孤立话题。Figure 3覆盖FM更新、脚手架更新与评估基准的统一分类树路径一基座模型改进θ——让模型自己给自己产数据按学习信号的形态θ 改进分三类Figure 6基座模型改进的三条参数更新回路5.1 内在生成示范S ≈ D模型即数据工厂模型从自身权重里挤出训练数据指令-回答对、推理轨迹、执行日志。代表工作Self-Instruct种子扩增、Evol-Instruct复杂度进化、LMSI自洽性过滤、Ladder递归分解出课程、TT-SI测试时检测不确定性 → 针对盲区现场生成数据 → LoRA即时微调极样本高效。⚠️ 核心风险模型坍缩与知识气泡——反复吃自己产的数据会放大偏见、窄化解空间。缓解手段保留真实数据打底、外部验证器/定理证明器把关、多样性感知的数据池扩展、人工审计。5.2 内在评估反馈S ≈ e模型当自己的裁判不再产例子而是产判断分三族Rubric反馈按显式准则打分排序——Constitutional AI、Meta-Rewarding连裁判的判断本身都再评一遍、Self-Evolved Reward Learning一致性反馈多次采样取共识/熵/自我确信度——TTRL测试时多数投票当奖励、INTUITORself-certainty当内在奖励纠正性反馈产出批评修订稿——SELF、RISE、Reflect-Retry-Reward。⚠️ 致命软肋评估器与策略同源耦合会奖励表面合规而非真实改进一致性只是正确性的代理模型系统性犯错时重复采样只会放大同一个错误。5.3 外在探索经验S ≈ τ环境说了算信号接地于行动后果分两种环境真实任务环境程序化验证器单元测试如Agent-RLVR、学习型奖励模型WebRL、UI-Genie、自生成任务Absolute Zero自己出题自己答执行验证定生死模拟代理环境World Model先学环境动力学再脑内演练——WebEvolver协同进化的网页世界模型、WMPO像素级世界模型上做想象rollout。⚠️ FM时代特有的坑语言版reward hacking钻LLM裁判的措辞漏洞、能力退化窄奖励RL侵蚀预训练通用能力、幻觉动力学生成式模拟器编出貌似合理的错误转移策略学会利用幻觉。路径二脚手架改进Σ——不动权重照样进化这是对工程师最实用的部分按组件拆成四层干预深度递增。6.1 Prompt信号越来越有营养的四代范式Figure 7Prompt精炼作为自我改进循环及其四范式标量反馈优化只有分数没有方向靠搜索——APE、OPRO、RLPrompt、InstructZero定性反馈精炼文本批评驱动定向修改——Self-Refine、Reflexion、ACEGenerator–Reflector–Curator模块化上下文工程种群进化prompt当基因做选择/交叉/变异——EvoPrompt、Promptbreeder连变异指令也一起进化自指、GEPA反思引导进化号称可超过RL文本梯度把批评形式化为方向性更新向量——APO、TextGrad文本版自动微分、MetaTextGrad优化优化器自己的prompt、SkillOpt。一条清晰主线信号从标量 → 批评 → 种群适应度 → 结构化方向指导优化越来越不依赖启发式、越来越自动化。Table 2四种prompt优化范式的信号/目标/代表系统/优劣对比6.2 Memory从静态缓存到自治引擎三个维度拆解记忆对象显式加工后的轨迹/精选原文/整合外部知识——可解释、可审计vs 隐式latent embedding/KV增强——紧凑快速但难调试记忆结构扁平便宜但有近因偏差→ 层级压缩长历史但结构脆弱→ 图关联检索支持多跳归因维护复杂→ 向量检索语义召回默认项但相似≠有用记忆处理信号驱动的CRUDCreate选择性蒸馏写入 / Read混合启发式门控检索 / Update定期复习衰减迭代蒸馏 / Delete多级剪枝分层驱逐外加 Select写谁读谁与 Maintain保鲜与遗忘两维治理。代表系统Mem0、A-MEM、Zep时序知识图谱、G-Memory层级图混合、MemoryOSOS式分层驱逐。6.3 Tool从会用工具到工具治理元认知动态路由检索与图路由ToolNet、OrchDAG把工具依赖建成有向图、策略学习路由Tool-Star、AGENTFLOW、ToolGen把检索-选择-调用坍缩成单一生成过程、主动交互式路由MCP-Zero主动发现工具、Tool-Planner局部API级修复迭代精炼生成-执行-修订闭环——Voyager奠基STELLA加专职criticSkillWeaver蒸馏可复用web工具DRAFT专改工具文档很多失败源于指令与工具语义的错位而非代码bug自主创造TOOLMAKER打通从论文抽逻辑→装依赖→闭环调试→产出可调用接口全生命周期Alita/Code2MCP用MCP协议把代码库标准化为服务防止工具爆炸冲垮路由策略。6.4 Full Scaffolding把整个代码库当作可修改基板最深的干预层级agent把自己的全部操作逻辑和源码当作可改写对象形式化为Σ_{t1} I_{Σ_t}(Σ_t; S_t)——注意改进器 I 下标就是 Σ_t 自己改进器与它改进的系统共同进化。实践中落地为生成补丁 → 验证器门控单测/回归/安全检查→ 通过才提交。Figure 10跨迭代的脚手架自我改进示意代表系统Darwin Gödel Machine维护agent档案库、开放式长出后代树、Huxley-Gödel Machine用clade级元生产力CMP近似哥德尔机理想、GödelAgentmonkey patching自修改、Live-SWE-agent首个运行时在线自我进化的SWE agent、AlphaEvolve/ShinkaEvolve程序进化、STOPSelf-Taught Optimizer递归调用自身改进、Agent Symbolic Learning把agent当符号网络用自然语言损失/梯度做符号化反向传播。Figure 11自我改进agent的代表性应用领域学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】