主流多智能体架构为什么大多失败——它们输在结构,不在模型

📅 2026/7/25 14:28:28
主流多智能体架构为什么大多失败——它们输在结构,不在模型
引子一个反直觉的事实你大概听过这样的宣传把几个大模型组个团队让它们分工、讨论、互相检查效果就远超单个模型。听起来很美。但现实里绝大多数多智能体系统上线后要么悄悄产出更自信的错误要么陷入反复横跳的死循环要么干脆聊着聊着就不动了。本书《你拼命消除的正是智能》的判断很冷这不是模型太弱而是架构在结构层就错了。多智能体真正该解决的问题行业大多没碰行业花力气优化的又大多在错误的方向上。用一个贯穿全书的隐喻三句话说清智能像在黑屋里找钥匙——黑屋是结构化的不确定性手电是多支分区域的角色视角磁铁是外部真值锚。主流架构的失败可以逐一还原成手电没分开、磁铁没接上、或者干脆把屋子塞满了自己的回声。一、伪多智能体把模型当函数错误被原样传递最常见的多智能体其实是一条写死的流程图刚性 DAG节点 A 调用模型产出字段 → 节点 B 接收 → 节点 C 接着干。脚本只检查字段齐不齐、格式对不对不检查内容对不对。这就是书里说的把 LLM 退化成函数调用器。问题不止模型被压平、没了意外更要命的是错误会沿节点无声传递——一个形状合法、内容却错的前提被原封不动喂给下一节点在其上继续推理越积越偏。书称它为跨节点污染脚本管格式磁铁管真值二者是不同机制但病灶同源闭包内没有真值锚错误携毒GIGO传递。举个具体例子。设想一个自动写接口的流水线规划 Agent 假定某个 API返回 JSON把这一前提写进方案编码 Agent 收到方案照着写了 JSON 解析审查 Agent 读的是同一份方案于是也按JSON去验收。三个 Agent 全部通过——但它们共享同一个错误前提从没人真的去敲一下那个 API、看它到底返回什么。错误没有被任何一道关卡拦下只是被复印了三遍。这不是多智能体这是一个错误被流水线复制了三次。书里点得很准共识达成了三个 Agent 一致但这是共识质量低——一致就是一致分不出真假问题是它建在错误的种子上。二、角色弱化五个 Agent其实困在同一个盲点里很多团队号称我有研究员、写手、批评家、编辑……“——细看它们的角色提示往往只换了人设标签没做真正的角色条件化”没让每个角色在风险↔速度、规范↔范围等决策轴上长出相互去相关、显著可分的输出分布。书判断分化够不够看的正是这条尺——输出端条件分布在决策轴上是否显著可分视角重叠面大不大而不是有没有共享同一套训练先验也不是有没有引入外部记忆/工具/信息源同基座角色本就共享同一套语义先验书 §5.1.4 明说这不碍事角色提示本身同基座上就能产出真实的结构化冲突外部记忆/工具只是进一步的增强手段不是门槛。只换人设标签、条件化不足视角重叠面就大——这才是分化程度低。分化只有程度之分没有真假。这里有个极易踩的坑书在 §5.1.4「同基座之问」里专门点名同基座本身不是问题。七个角色跑在同一个基座、权重一模一样只要经规范审查者性能优化者等角色条件化输出端在风险↔速度、规范↔范围等决策轴上就能显著可分——“同基座 角色提示产生的是真实的结构化冲突不是采样噪声”。书原话不要求不同基座权重这是读者最易卡住的误解。“真正判死刑的是同基座且无结构”。所以角色弱化的真正根因就落在视角重叠面大上角色之间看问题的角度高度重合没长出不同的优先级与盲点书 §5.1.4 说这正是“视角去相关 / 分布可分”的反面。视角一重叠角色就难以引入独立视角去互相照亮于是当它们达成共识时落到的是共识质量差——N 份相同偏见收敛到同一个自信的错误书 §3.1.5a / 四诫 #2一致就是一致、分不出真假但建在共享盲点上放到统一标准下校验、或放进结果导向情景错误率就高。书在 §5.1.4「同基座之问」里给的同一把尺——判断分化够不够看输出端条件分布在决策轴上是否显著可分视角去相关 / 分布可分可分多角色就是“多支手电分区域去找扩大覆盖”书 L1118不可分角色再多也只是同一视角摆了 N 个相似角度——照到的地方一样、盲点也一样成本翻 N 倍、错误也复印 N 份。例子。假设底层语料对“某段历史的因果”有系统性偏差。研究员 Agent 引述偏差、批评家 Agent 基于同一偏差去“挑错”、写手 Agent 又把偏差写进稿子——它们不是“困在同一个盲点里”那是更深的共享先验问题见下而是视角大面积重叠各自的“独立审查”只是把同一段偏差用不同措辞复述了一遍缺了独立视角去互相照亮于是达成的是质量低的共识一致但错得一致放到结果导向情景里错误率就高。所谓“独立审查”是弱的根因不是“它们是同一个模型”同基座本身不是问题而是它们的视角重合度太高、去相关不足。治这病的杠杆有两道书 §5.1.4 的 (a)(b) 两分别混为一谈(a)独立条件化视角——让每个角色带不同的外部记忆、不同的工具、不同的信息源制造信息不对称性书 L1356 边栏缩小视角重叠面、让分布可分治角色弱化这一层(b)闭包外真值锚——当共享先验本身在某处有误或有盲点这是同基座更深一层的边界内部角色自愈不了得靠 certutil / 磁盘哈希 / 数学悖论这类来自现实的锚把判断拽到闭包外但 (b) 治的是先验盲区不是角色弱化本身。三、记忆当收据上下文污染与循环推理两大癌症这是最隐蔽也最致命的一类。很多框架把记忆理解成把对话每句无差别塞回上下文。书把这种原始对话称为收据dump而非体外器官。两大癌症由此而生上下文污染第一轮里模型说错了一句前提这句话被原样回灌下一轮带着错误继续推理错沿轮次累积——与跨节点污染同构只是发生在轮次之间。循环推理推理链没有终止机制错又沿回灌跨轮退化成 step repetition反复重做同一件事甚至死循环。例子客服机器人的鬼打墙。用户开头说我的订单号是 12345其实记错了是 54321。机器人把整段对话当记忆一直按 12345 查。查不到 → “抱歉我重试” → 又用 12345 → 再失败。它记得了错误却永远走不出这个错误用户越纠正上下文越乱两边都在噪音里打转对话彻底无法进行。书给的根治之法不是更好的记忆而是斩断回灌边 用结构化、经仲裁的日志替代每轮重置原始上下文把循环死在本轮边界记忆只保留结构化且验真过的内容冲突上报、双审、规则更新后的项目日志。看似丢了信息实则没丢——项目有多个角色每轮所需上下文由角色定义 结构化日志两处持久源重组多角色互补重建出经仲裁的高保真记忆实测长任务目标始终稳定。比起混乱丢一点噪音不会带来太大问题真正保住的是绝大部分有效记忆且癌症无处着床。呼应第十四篇通用长记忆是死胡同的判准。四、该停不停、该停早停收敛门控的缺失多智能体系统还要面对何时算做完的问题。主流做法要么是跑满 N 步就停要么是模型自己说完了就停。这两道都不是真正的收敛门控。step repetitionMAST FM-1.3没有门控系统反复总结、反复重做永远不收敛烧光 token。过早终止MAST FM-3.1被预设步数或默认结束符截停把看起来聊完了当成做完了冲突其实根本没解决。书把收敛讲成一个动态过程——循环的不是动作而是不确定性每一轮尚未固定的不确定性缩小一分直到最后一个有依据的意外被裁决、被消化系统自然就不再转了。这类比 for/while 循环的退出条件但本质不同for/while 的done是人事先预设的布尔而收敛的停止是涌现的——不是外部拍进来的死线。把收敛读成while not 共识的预设布尔正是把信息循环误读成控制流循环的精确错误。共识是收敛的涌现退出条件但停了不等于稳了——这里危险只有一种把达成一致误读成已被正确性机制认证。五、根因一句话在笼子里装修而非跳出笼子把四类失败叠起来看书的诊断是一致的主流多智能体架构失败的根本原因是它们在封闭闭包内部做修补没有解决结构层的三件事——把不确定性变可结构、让冲突被仲裁、用外部真值锚收口。书用笼子概括三种结构性病态① 冻结推理期不可变② 自指闭环输出喂回自身③ 把消除不确定性当目标。最深的那个误区就是第三点行业总想消除不确定造更大的屋子、更长的上下文、更聪明的提示——但屋子里那一份光Σ1没变黑还是黑。更糟的是越想消除不确定越容易把错误当成确定、把自信当成正确。而书给出的出路恰恰反着来利用不确定性而非消除它。多支手电分区域照亮真正的角色分化外部磁铁验真真值锚按需接入让冲突进仲裁通道而非当噪音丢弃让收敛由冲突收敛 验收门控而非步数——这一切合起来才是结构化不确定性 真值锚的真正含义。落到工程就是书给出的四重纪律纵向防回灌每轮重置原始上下文 结构化日志替代、横向防混用话题/任务/项目隔离、结构化 仲裁后才成记忆、通用在元层组织设计快速组专门团队 分工。落点为什么这关系到智能本身最后收一句到全书脊柱。本书反复强调不可计算 ≠ 概率。概率Σ1、采样、似然是可算的大模型对概率不确定性的处理本身就是可计算工程但内容对不对、目标值不值、是否接地于人的价值这一层书称种子无法被封闭框架从内部归约。主流架构的失败根子上是想用确定性工程去算出本不可算的东西于是把噪音当信息、把自信当正确、把循环当收敛。能做的是管好通道用结构让不确定性浮现、被仲裁、被收敛而不是在循环里空转。多智能体的健壮性不来自更多模型而来自更对的结构——这才是主流架构普遍缺席、而本书反复在讲的那一课。诚实边界与全书一致以上结构处方每轮重置、结构化仲裁记忆、收敛门控、真值锚按需在 CoordClaw 实测档案里得到实例级验证但书稿自承收敛无可被数学度量、CoordClaw 只到已证层未证未知层的智慧跃迁本文提供的是工程机制与可操作判断不是多智能体必然成功的数学定理。把自证当共识是另一类过度宣称——书已把这一点写明。