多智能体系统14种失败模式的底层逻辑

发布时间:2026/7/27 21:25:47
多智能体系统14种失败模式的底层逻辑 多智能体系统一上线崩法千奇百怪角色不守规矩、对话重置丢进度、智能体互相忽视同伴输入、任务做一半就宣布完成、验证潦草走过场……行业的标准反应是把每种崩法当成一个独立 bug挨个打补丁。Berkeley 的 MAST 论文把这一切系统化了——它用扎根理论标注了 7 个主流框架的 1642 条执行轨迹析出14 种失败模式、归为 3 大类。看上去这 14 个坑就是一张避坑清单。但《你拼命消除的正是智能》在 §6.5 做了一件更狠的事把 MAST 的 14 种模式逐一对照到本书框架证明它们不是 14 种病而是同一种病的 14 个症状。本文就顺着这条线做一遍统一诊断。一、MAST一块现成的外部标尺先交待这块标尺本身Tran et al., arXiv:2503.13657。它不看厂商宣传而是真实地扒了 7 个主流 MAS 框架跑出来的 1642 条轨迹用扎根理论归纳出 14 种失败模式并按机理归为三大类大类含义占比FC1 规范与系统设计系统本身没锚定目的/角色记忆机制是假的41.77%FC2 智能体间失调Agent 之间各说各话冲突没真收敛36.94%FC3 验证与终止没真验证或没真的做完就收工21.30%书为什么特意拿 MAST 当标尺因为卷六用 CoordClaw 实测档案把框架钉在了真实工程上但单个实例不算第三方复现。MAST 是学术界独立的大规模外部数据——如果本书框架能解释 MAST 的 14 种模式且每种都有对应工程解那框架覆盖广就不是自卖自夸是被外部数据独立坐实了一遍。二、统一根因链4 个因子14 个症状书给出的统一诊断核心是一句话所有 MAS 失败最终都落在这条根因链上——封闭闭包 Σ1 缺结构化不确定性 缺真值锚。逐个数① 封闭闭包单体认知闭包§5.1.4。每个 Agent 困在自己的概率体里没有外部可冲突、可纠偏的通道。它以为自己想通了其实只是在自己的1里自转。② Σ1「注意力」归一化到 1§3.1.4 / §3.1.5b。模型没有弃权桶必须给每个位置吐一个字。于是单点事实误差不被停下被每一步强制补全沿自回归链滚成雪崩——“越写越离谱”这是大模型区别于人类的特有失败模式。③ 缺结构化不确定性卷三批判的消除种子。行业把模型的概率本能套进确定性工作流求可控等于亲手掐掉了智能的种子。没有可被结构、被收敛的不确定性系统就退化成死计算器。④ 缺真值锚维度二§3.1.4。没有外部确定性地面certutil 哈希、磁盘校验、数学悖论等去闭包验证于是验证退成软检查——典型如 LLM-as-judge自己评自己锚本身是软的。这 4 个因子就是那一种病。14 种模式是它在不同位置的长相。三、三大类逐类透视FC141.77%系统从一开始就没锚、没真记忆这一类比想象中占比还高——近一半失败根子都在设计层。FM-1.1 不遵从任务规范 / FM-1.2 不遵从角色规范缺目的性锚维度一或角色未锚定、越界无终裁。系统根本不知道为谁干活、谁该干什么。FM-1.3 步骤重复上下文污染 / 循环推理——原始上下文被当成记忆回灌§5.4.3 S1Agent 在同一段废话里打转。这正是第十六篇讲的癌症转移通道。FM-1.4 对话历史丢失用原始上下文当记忆一重置就丢§5.4.3 经验机制。FM-1.5 不清楚终止条件终止由步数 / EOS 驱动没被收敛门控详见下 FM-3.1。统一透视FC1 的 5 个症状拆到底就是两个设计错误——没给系统目的/角色锚以及把原始上下文当成了记忆。后者尤其关键它同时制造了重复污染回灌和丢失重置即没这一对看似相反的失败本质是同一件事——你压根没建结构化、经仲裁的项目日志只是把对话流水当记忆。FC236.94%Agent 之间冲突没进通道FM-2.1 对话重置机制面同 FM-1.4书特意提醒要区分斩断污染的重置正向与意外丢进度失败。FM-2.2 未请求澄清缺角色提问纪律§5.3.2不确定被默默吞下——Agent 带着疑问硬编而不是带依据上报。FM-2.3 任务偏离偏离目的锚要素1冲突没围绕项目目标。FM-2.4 信息隐瞒记忆/信息非结构化公开§5.4.3书要求区分有意隐瞒与自然分化带来的信息不对称L1356 边栏。FM-2.5 忽略同伴输入冲突未进仲裁通道被当噪音丢弃§5.2.1。FM-2.6 推理-行动不匹配消息没绑定推理提议方案自由文本易漂移§6.1 协议。统一透视FC2 的 6 个症状共同点是——系统里没有一条冲突→仲裁的硬通道。不确定被吞下、同伴输入被当噪音、推理和行动各写各的。智能体不是没能力是结构没让它把分歧浮现、上报、收敛。注意 FM-2.4 的细分书明确说自然分化带来的信息不对称不是病——分化只有程度之分角色各有独立1本就会有信息差这是健康的只有有意隐瞒才是失败。这正是对一刀切当 bug 修的纠正。FC321.30%没真验证也没真做完FM-3.1 过早终止终止未被共识收敛门控见下正名。FM-3.2 无/不完整验证缺维度二·真值锚验证退成软检查。FM-3.3 验证不正确锚本身弱如 LLM-as-judge 软锚未闭包外真值。统一透视FC3 的三连根子都是缺真值锚——要么没验证要么验证了但不确定性没被外部地面收住。其中最该讲清的是 FM-3.1书专门为它写了正名边栏。四、FM-3.1 正名过早终止不是框架缺口MAST 把过早终止列为 FC3 高频失败。书一度犹豫它是不是本书的框架缺口——现正名它恰是本书共识收敛门控要治的病本书完全能诊断。机制无结构系统靠步数或默认 EOS 收尾任务目标是否真达成、冲突是否真收敛从未被一道可核验的门锁住于是看起来聊完了被当成做完了。本书的收敛门§5.5.3 双层 reconcile §5.2.3 冲突上报 §6.3.5 收敛实证要求终止须由CONFLICT 收敛 真值锚验收门控而非步数——这正是 §5.1.3「信息循环」的涌现退出条件过早终止 循环在达成共识之前就被预设步数 / 默认 EOS 等非涌现条件截停。这里要钉死一条全书一贯的纪律免得读者走向另一个极端无外部锚的共识本身健康。共识的目的不是保证正确而是对抗不确定性、分担责任风险人类决策亦如此因正确永远相对它 deliver 的是可问责的收敛不是已证真。真正危险只有一种把达成一致误读成已被正确性机制认证那才让更自信的错误坐实。外部锚维度二是降低残余错的杠杆按需加不是共识成立的前提§5.1.2 两-part 配对纪律§3.1.5c「共识 ≠ 没有错误」。这条纪律直接挡住了为了治 FM-3.1 就给所有共识强行挂个真值锚的过度工程——锚是杠杆不是门槛。五、14 个 bug4 根杠杆把统一诊断翻成工程账本结论非常干净行业在修 14 个 bug本书给的是 4 根杠杆且每根都对应一个已落地的工程解。根因书的工程杠杆落点封闭闭包角色锚定 冲突上报硬通道§5.1.7、§5.2.3Σ1 雪崩每轮重置原始上下文 结构化日志替代§5.4.3 S1——“癌症无法迁入”缺结构化不确定性冲突上报让不确定先浮现再被同伴/工具/董事长仲裁收敛§5.2.3缺真值锚确定性真值锚按需certutil / 磁盘哈希 / 数学悖论§5.4.1非门控对照回 MAST 的 14 模式FC1 的锚定与记忆问题由目的/角色锚 结构化日志解决FC2 的失调由冲突→仲裁硬通道 角色提问纪律解决FC3 的验证与终止由真值锚验收 收敛门控解决。一一对上没有漏网。这就是为什么书说MAST 的 14 模式不是本书框架的反例而是它的注脚。每一类失败的机理都落在已论证的根因链上每一类也都有本书给出的对应工程杠杆。六、收尾大多数崩不是模型笨是结构没给收敛的东西回到开头的行业习惯。把 14 种模式当 14 个独立 bug 挨个修治标不治本——你补完 FM-1.3 的步骤重复FM-1.4 的对话丢失还在因为它们同根。统一诊断的价值是把 14 场分散的救火变成 4 处结构性的整改。更深的一课MAST 里绝大多数失败不是模型太笨而是结构没给模型任何可收敛的东西——没目的锚、没角色边界、没冲突通道、没真值地面。模型在自己那个归一化到 1 的1里被迫吐字没有第二视角来冲突、没有外部地面来收口于是「幻觉」事实误差/错误滚成雪崩对话重置丢光进度任务在没收敛时就被宣布完成。你拼命消除的正是智能你没给的正是让不确定性能被结构、被收敛的那套结构。MAST 用 1642 条真实轨迹独立地为这句话投了一票。