全球⾸个⼤规模 Agentic 扩散模型来了!

📅 2026/7/29 8:25:14
全球⾸个⼤规模 Agentic 扩散模型来了!
在人工智能的发展史上长期取得决定性胜利的往往不是人类精心编写了大量专业知识的系统而是那些能够随着算力、数据和搜索规模不断扩展的通用学习方法。还记得「苦涩的教训」The Bitter Lesson吗在人工智能的发展史上长期取得决定性胜利的往往不是人类精心编写了大量专业知识的系统而是那些能够随着算力、数据和搜索规模不断扩展的通用学习方法。苦涩的教训提醒我们不要把人类解决问题的方式认为是智能系统唯一正确的计算方式。语言模型并不必须是自回归的。扩散式语言模型早就成为了一个研究热点。通过并行去噪、全局修订和迭代生成提供了另一种可能。而扩散语言模型的全新里程碑已经出现蚂蚁团队正式发布并且开源 LLaDA2.2全球⾸个⼤规模 Agentic 扩散模型让扩散语言模型的技术路线再进一步正式迈入智能体时代。为什么在此之前扩散语言模型不能成为主流路线呢我们曾经报道过一篇研究工作《The Bitter Lesson of Diffusion Language Models for Agentic Workflows》。研究团队系统评测了 LLaDA、Dream 等一批扩散语言模型结论并不乐观在具身规划任务中dLLM 会反复尝试同一个失败动作无法根据时序反馈切换分支在工具调用任务中它们在并行去噪的扰动下难以维持严格的 JSON schema。效率上的想象空间与可靠性上的实测表现出现了明显落差。ICML 2026 上的最佳论文《The Flexibility Trap》中指出扩散模型最被称颂的那项优势也就是任意顺序生成所带来的更大解空间在数学和代码这类推理任务上反而构成了陷阱。模型倾向于利用顺序自由度绕开高不确定性的 token优先填充容易的位置等到处理关键决策点时周围上下文已经把答案限定解空间过早坍缩。这两篇工作指向扩散语言模型的同一类问题也无情地揭示了其过去无法胜任现实任务的事实。扩散语言模型凭块并行解码拿到了自回归模型难以企及的速度上限LLaDA2.0 把这条路线推到 100B 参数LLaDA2.1 又靠 token 编辑机制在 HumanEval 上跑出 892 TPS但这些都是在静态生成中展现的数据。可一旦进入 Agent 那种需要追踪长交互历史、调用外部工具、处理环境反馈并修正自身行为的连续闭环整套范式的稳定性就开始摇摇欲坠。症结在于「一次性生成」。传统扩散模型的编辑能力被限制在等长替换上一个 token 只能换成另一个 token无法删除一段冗余也无法在指定位置插入新内容。序列长度固定结构刚性。早期 block 中的微小偏差会作为硬约束进入后续 block 的条件上下文一路固化下去。这正是 LLaDA2.2 切入的突破口。LLaDA2.2 训练与推理框架概览蚂蚁已发布 LLaDA2.2 的技术报告感兴趣的读者可以查看。模型地址https://huggingface.co/inclusionAI/LLaDA2.2-flash代码仓库https://github.com/inclusionAI/LLaDA2.X技术报告https://github.com/inclusionAI/LLaDA2.X/blob/main/LLaDA2_2_tech_report.pdf四种原子操作写入去噪过程首先让我们来看 LLaDA2.2 最大的亮点。在前一代工作 LLaDA2.1 中已经采用了称为 Token-to-TokenT2T的编辑机制。那时候的 T2T 编辑只支持两种动作保留keep和替换substitute。位置对位置长度不变。这套机制能修正局部的错误 token却无法处理结构性缺陷。n-gram 重复需要删除冗余片段工具调用缺失参数需要插入新内容代码补丁不完整需要扩展长度T2T 对这三类问题均无能为力。Levenshtein 距离是计算机科学中的经典度量1965 年由苏联数学家 Vladimir Levenshtein 提出用来衡量两个字符串之间的差异把一个序列变成另一个序列最少需要多少次单字符操作。允许的操作有四种替换、删除、插入与保留构成一组完备的编辑原语。任意两个序列之间的转换都可以分解为这四种操作的组合。关键在于这组原语里有两种操作会改变序列长度。删除让序列变短插入让序列变长。而这正是此前扩散语言模型缺失的能力。LLaDA2.2 把动作空间扩展到四个原子操作KEEP保留、SUBSTITUTE替换、DELETE删除、INSERT插入。后两者以编辑控制 token 的形式存在。在位置 i 上DELETE 移除当前 token 并将后续 token 左移INSERT 则把 x_i 扩展为[MASK], x_i为后续去噪轮次创造一个可填充的新位置。序列长度与 token 位置由此首次成为并行解码过程中可以动态改写的对象。难点在于监督信号的来源。模型生成的中间草稿与 ground truth 之间需要一份逐位置的编辑标签。LLaDA2.2 的做法是计算两者的最长公共子序列LCS以匹配位置作为锚点推导标签匹配锚点标为 keep锚点之前的空隙内对齐位置标为 substitute草稿多余的位置标为 delete目标序列多余的位置则为后一个锚点分配一个 insert 标签。最后一个锚点之后的所有草稿位置全部标为 delete若整个块内不存在锚点则所有位置均标为 delete。这一改动带来的增益有多大从消融实验来看同一个 LLaDA2.2 基座同一批 SWE 轨迹数据唯一变量是是否启用 Levenshtein 编辑。SWE-bench Verified 上35.8 对 44.4绝对提升 8.6 个百分点。对于仓库级软件工程这类高度依赖结构完整性的任务允许插入与删除所带来的收益相当可观。这也是业界首次将 Levenshtein 编辑大规模集成进扩散模型的去噪过程。扩散模型由此从静态生成器转变为具备生成中途自我修正能力的动态系统。这标志着扩散模型第⼀次真正拥有了参与⻓程任务的能⼒。L-EBPO让环境反馈驱动编辑决策具备编辑能力之后下一个问题是何时编辑、编辑何处。这属于决策层面的问题超出了语法判断的范畴且只有在真实环境中才存在正确答案工具调用是否报错、格式校验是否通过、任务是否停滞这些才是判断依据。dLLM 做 RL 的根本困难在于似然计算一次生成轨迹包含多轮块级去噪模型并非按 token 顺序逐个决策精确的序列级似然难以高效求解而策略梯度方法恰恰需要新旧策略的概率比。LLaDA2.2 的方案名字很长基于 Levenshtein 编辑证据下界的分块策略优化方法简称 L-EBPO。顾名思义把多轮交互中的编辑决策建模为强化学习问题。L-EBPO 的结构是一个两层控制体系。外层由 EBPO 治理优化跨越 Agent 交互轮次的轨迹级决策管的是整条交互链路上的策略取向内层管理块内的拼接编辑即在单次生成步中何时、何处施加 DELETE 与 INSERT。两层的时间尺度差异很大一个以轮次为单位一个以去噪步为单位。L-EBPO 的做法是通过一个扩展动作空间将两层统一到同一个目标函数下token 预测与编辑决策因此被纳入同一目标函数优化。注意力掩码上还有一处专门处理。多轮 Agent 轨迹与单轮响应不同若一个扩散块内包含多轮模型输出与工具返回除首轮之外的所有轮次都必须被掩蔽否则块内全注意力将造成信息泄漏。奖励信号完全来自环境反馈由工具调用执行正确性、输出格式合法性、任务整体完成度三项相加构成。三项分别对应 Agent 失败的三类典型模式工具调不通、格式不合规、任务没做完。奖励设计的直接后果是模型的编辑策略被环境校准什么样的删除和插入能提高工具调用成功率什么样的修改能让格式通过校验这些都由执行结果给出反馈不依赖预设规则。传统纠错方法只能在错误表面做覆盖式修正无法触及需要改变序列拓扑的结构性缺陷。L-EBPO 提供的是另一种路径一套由环境反馈驱动、能够执行实际删除与补全的自我修正策略从轨迹层面阻断错误在长程交互中的传播链条。真正解决了《The Flexibility Trap》提出的结构性问题。128K 原生上下文与一个固定容量的专家池Agent 任务对上下文长度有天然要求上下文是智能体执行任务的「弹药库」而这正是过去 dLLM 的弱势区间。LLaDA2.2 的起点是 LLaDA2.1 的 8K目标是 128K跨度 16 倍。上下文扩展并不只是把窗口参数改大。模型的位置表示、注意力分布模式、块扩散的去噪行为都需要随之调整。为此研究团队采取的是分两级推进的方法先在 64K 长度上续训 300B token再扩展到 128K 上续训 200B token。训练数据的组织也有讲究。这一阶段以长文档和仓库级代码为主重点是有效长度真正落在 64K 至 128K 区间的样本。拼接时采用文档感知的 packing 与注意力边界也就是让每篇文档只关注自己范围内的内容。这一点对扩散模型尤为重要扩散模型的注意力是双向的如果不设边界同一个 batch 里拼在一起的无关文档会相互「看见」模型学到的会是虚假的双向依赖关系。Agent 数据被安排在最后的 128K 阶段才加入包括长软件工程上下文、工具使用轨迹和浏览轨迹。这个顺序是有意的先让模型把长上下文的基本能力练稳再教它在长上下文里做 Agent。最终模型才能实现原生支持 128K 的上下文长度。更棘手的问题出现在 MoE 架构上而且这个问题是块扩散特有的。MoE 的工作方式是每个 token 只激活一小部分专家比如从 256 个专家里选 8 个以此在参数总量很大的同时保持单次计算量可控。自回归模型每步只生成一个新 token激活的专家自然也就是那 8 个左右负载稳定。但块扩散一步要并行处理整个块通常是 32 或 64 个 token。如果块内每个 token 各自独立挑选专家那么这个块实际需要加载的专家就是所有 token 选择结果的并集。若每个 token 各自独立路由一个块触及的专家集合就是所有 token 选择的并集后果是 HBM 流量上升、专家权重复用率下降、专家并行下的 dispatch/combine 通信成本增加。为了保证模型的吞吐、延迟与首 token 时间研究团队采用了一种 Block Routing 块路由的设计。Block-diffusion MoE 中 Block Routing 过程示意。Block Routing 的设计依据是团队在 LLaDA2 系列上的一项实测尽管 token 级路由整体呈现分散状态但同一块内部的专家偏好高度集中少数专家承担了大部分路由流量。据此固定容量的块级专家池成为块扩散推理的合理选择。具体做法是让路由单元与扩散生成单元对齐。块级准入分数通过 token racing 策略计算即每个 token 都有机会提名自身偏好强烈的专家。块随后按 g 准入 top-C 个专家形成固定容量专家池 P。该设计为每个块提供了可预测的专家工作集上界 O (C)改善了显存规划与专家并行执行同时 token 级选择在准入池内依然保留模型并未将路由退化为单一的块级决策token 级专精得以保持。技术报告中表示在后训练之后切换到 block routing 对模型质量几乎没有损害。原生长上下文真正决定了扩散模型具备智能体领域工程部署的价值。上下文与成本这两个条件同时满足之后模型能力才能转变为可以在成本敏感场景中落地的工程能力。与自回归模型正面竞技评测覆盖 17 个基准其中 7 个 Agent 类、10 个通用类与同参数的自回归模型 Ling-2.6-flash 进行比较。7 项 Agent 基准上LLaDA2.2-flash 平均 53.83Ling-2.6-flash 为 55.74分数非常相近。・τ²-Bench多轮工具 - Agent - 用户交互80.33 vs 76.36领先・PinchBench真实场景 AI 编码基准81.66 vs 81.30领先・MCP-Atlas真实 MCP server 工具能力46.21 vs 41.12领先 5.09 分・Claw-Eval自主性64.22 vs 64.56基本持平LLaDA2.2-flash 在交互式工具使用任务上具备非常强的竞争力。长上下文能力同样得到验证。10 项通用基准中LLaDA2.2-flash 在 LongBench v2 上以 45.13 反超 Ling-2.6-flash 的 42.94与 128K 上下文扩展的目标相吻合。效率是扩散语言模型的传统强项LLaDA2.2-flash 在保证基准能力不掉队的情况下实现了超高的效率。BF16 平均吞吐量达 Ling-2.6-flash 的 1.64 倍FP8 量化后额外提升 18.6%并且任务越重、上下文越长扩散并行解码的优势越明显。这是一次效率与 Agentic 能力的双重证明性能与顶尖自回归模型处在同一区间且在关键交互任务上领先吞吐则是对方的 1.64 倍。在成本敏感的 Agent 部署场景中这一组合具备直接的现实价值尤其是 Agent 任务往往需要在单次会话里完成数十轮推理吞吐上的倍数差异会逐轮累积为端到端延迟和成本的显著差距。更多信息请参阅原论文。结语扩散语言模型一直是一个偏科生。效率上的巨大优势似乎是由绝对能力换来的。但当 LLaDA2.2 证明了扩散语言模型能够胜任智能体任务的时候其效率上的绝对优势就完全无法忽视了。对于正在评估 Agent 技术路线的团队来说LLaDA2.2 已经不仅仅限于一个研究样本而是一个可以被认真放进候选名单的基础模型选项。自回归与扩散这两条路线的竞争还会持续很久。但可以确定的是Agent 时代正在重新定义什么才是一款真正优秀的模型。它需要的不只是一个能够把答案说得漂亮的生成器更是一个能在漫长任务中持续判断、发现错误、修正方向并始终记得最终目标的执行者。在这个新的评价标准下会自我修改的模型或许才刚刚开始展现它真正的想象空间。