oka架构

发布时间:2026/7/21 22:24:26
oka架构 去年Rich Sutton 在 Alberta Plan for AI 会议上的演讲: 通往强 AI 的路径是强化学习而非大语言模型一、为什么需要 Oak 架构AI 的目标是理解人类思维、并放大人类能力这是堪比生命起源的智识里程碑。但当前 AI 的发展路线以大语言模型为代表偏离了真正智能的本质。当前 AI 的核心问题维度现状LLM 路线Sutton 的主张学习时机Design time设计阶段训练Run time运行时在线学习知识来源大量离线训练数据纯粹从运行时经验中学习领域依赖高度依赖特定领域数据Domain general不内置任何领域知识抽象能力固定架构无法随经验增长开放式的抽象层次按需构建“The biggest bottleneck is we have inadequate learning algorithms.”二、Oak 架构的三大设计目标Domain general领域通用架构本身不应包含任何特定于某个世界的知识Experiential从经验中学习心智应从运行时经验中生长而非从特殊训练阶段产生Open-ended开放式抽象的复杂度和层次无上限仅受计算资源限制Design time vs Run timeDesign time设计阶段在工厂里被构建内置领域知识Run time运行时智能体在世界中交互、从经验中学习、针对所处世界的特定部分做规划大语言模型的一切工作都在 design time 完成部署后不再学习。Oak 架构则相反所有重要的事情都要在 run time 完成——在线、在岗on the jobBig World庞大世界假设智能体相对它所面对的世界是渺小的无法在工厂中预知世界的一切细节。因此想学到任意开放式的抽象必须在 runtime 完成必须由世界本身告诉智能体哪些抽象是对的三、两个关键设计问题的回答Sutton 连续抛出两个问题来约束 Oak 的设计哲学问题 1智能体的设计是否应该反映它将被使用的世界如果追求性能应该内置领域知识让它能立刻表现良好如果追求概念简洁性理解心智如何运作不应该Oak 的选择后者。设计应该与具体世界无关仅基于原理而非错综复杂的领域细节。引用 Sutton 自述的苦涩的教训Bitter Lesson精神“The actual contents of minds are part of the arbitrary, intrinsically complex outside world. They are not what should be built in as their complexity is endless. Instead, we should build in only the meta methods that can find and capture this arbitrary complexity. We want agents that can discover like we can, not which contain what we have already discovered.”问题 2智能体应该从特殊训练数据中学习还是只从运行时经验中学习Oak 的选择仅从运行时经验学习entirely experiential。论证逻辑某些事情必须在 runtime 做学到的抽象会改变、做世界模型、规划……如果这些事情能在 runtime 做那么所有事情都应该在 runtime 做这样能得到一个概念上更简洁的设计四、Oak 名称的由来O来自Options andKnowledge。Option选项在 Sutton 的定义中option 是 (policy, termination) 这一对——一个行为策略加上一个决定何时停止该行为的条件他故意省略了 initiation setKnowledge知识在 Oak 中智能体将拥有大量 options知识就是跟随某个 option 会发生什么通过学习 options 及其后果智能体构建出高层转移模型high-level transition model从而能以更大跳跃做规划并沿世界的关节处切割carve the world at its joints。五、Oak 的整体愿景Sutton 用一个图形化比喻描述 Oak 的目标寻找 AI 的圣杯holy grail。理想的 AI 设计具备Domain general不内嵌任何世界特定知识概念上简洁principles-based而非细节堆砌能在线学习高层结构这与追求立刻就能跑得好的应用导向工程形成鲜明对比。Sutton 明确表示“My quest is the latter”——他的目标是获得对心智的概念性理解而非某个具体应用的最佳性能。六、Oak 与 Alberta Plan 的关系Sutton 提到他遵循 Alberta Plan for AI Research他和 Michael、Patrick 等人几年前提出的研究框架。Oak 是该计划下的具体智能体架构提案被视为通往理解心智这一终极目标的路径之一。总结强化学习是通往强 AI 的必经之路而非大语言模型这类非经验性的方法学习算法才是最大瓶颈不是算力或数据规模真正的智能必须从经验中诞生且应在运行时持续学习架构应保持领域无关只内置能发现和捕获任意复杂性的元方法抽象必须是开放式的随经验无限扩展仅受计算资源限制