Patronus AI提出用扩散语言模型打造更聪明的训练环境

📅 2026/8/1 4:27:48
Patronus AI提出用扩散语言模型打造更聪明的训练环境
这项由Patronus AI独立完成的研究以预印本形式发布于2026年5月7日论文编号为arXiv:2607.16204v1分类于计算机科学人工智能领域。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。**研究从一个现实困境出发**每当我们训练一个AI助手去处理复杂任务——比如帮你预订机票、排查代码错误、或者处理客服投诉——研究人员都需要给它搭建一个练习场。这个练习场通常由人工精心设计什么情境下会出现什么结果哪些工具可以调用什么样的反馈算成功。问题在于这些练习场是死的——它们不会随着AI变聪明而变难也不会主动生成AI没见过的新情况。随着AI越来越厉害固定练习场带来的麻烦越来越明显。AI会把特定练习场的套路记得滚瓜烂熟但换到真实环境里就抓瞎。更糟糕的是当AI已经能轻松完成所有练习任务时它就很难遇到犯错→被纠正→进步的机会奖励信号变得稀少训练效果急剧下降研究人员管这个叫模式崩塌——就像一个棋手只练一种开局遇到别的走法就不知所措。一个自然而然的解决思路是与其手工搭练习场不如训练一个AI来模拟练习场本身。这类系统被称为世界模型——它能根据AI的动作预测环境会怎么反应从而生成无穷无尽的虚拟训练场景。早期的世界模型研究主要用在电子游戏和机器人领域而Patronus AI这项研究则聚焦于文字型世界模型也就是用语言来描述环境状态、动作和结果的那类系统。然而现有的文字世界模型几乎都基于传统的大语言模型LLM——也就是我们熟悉的GPT这类模型。Patronus AI的研究团队发现这类模型有一个根深蒂固的结构性缺陷会严重影响世界模型的质量。他们提出了一种截然不同的替代方案并通过大规模实验证明了其优越性最终让用这个新型世界模型训练出的AI助手在完全陌生的测试环境里性能提升幅度最高达到47%。---**一、传统大语言模型为何是单行道司机**理解这项研究的突破得先弄清楚传统大语言模型的一个本质局限。传统的大语言模型生成文字的方式就像一个只能往前走的打字机从左到右一个字一个字地敲每敲一个字只能看到它前面已经打出来的内容绝对看不到后面的字。这种方式被称为自回归生成它在写故事、聊天、回答问题上表现极好但在模拟一个环境状态时会碰到大麻烦。研究团队用一个非常直观的例子来说明这个问题。假设一个AI助手调用了一个处理退款的工具工具返回的结果是一段JSON格式的数据包含多个字段票据编号、用户ID、退款是否成功、错误代码、处理结果……还有一个关键字段状态其值是error出错。当传统大语言模型来模拟这个工具返回结果时它从左往右生成。它先生成退款是否成功这个字段因为只能看到前面的内容工具名称和部分参数它可能生成成功接着生成错误代码它根据成功这个前文生成null无错误接着生成处理结果它填了已完成。然后它终于到达最后一个字段——状态结果是error。问题出现了前面已经生成了退款成功、无错误、已完成后面却显示error。这个输出在逻辑上是矛盾的但由于模型只能看到已经生成的内容无法回头修改这个自相矛盾的状态就这么被输出了。研究团队把这个现象叫做前缀一致但全局不连贯——每一小段都合理但整体拼在一起就乱套了。更严重的是这类错误会污染下游的AI训练。当AI拿着这个自相矛盾的工具返回结果去学习退款失败时我应该怎么做它接收到的是一个充满矛盾信号的训练样本学习效果可想而知。---**二、双向扩散从照片冲洗到语言生成**Patronus AI提出的解决方案叫做掩码扩散语言模型英文缩写是MDLMMasked Diffusion Language Model。要理解这个名字可以从一个熟悉的场景切入。老式胶片相机拍完照片之后需要在暗房里冲洗。刚放进显影液时相纸上什么都看不见随着时间推移图像逐渐从模糊变清晰——先是大致轮廓然后是细节整张照片一起从朦胧浮现出来。这个过程和MDLM的工作方式非常相似。MDLM在训练时会把一个完整的目标文本比如一条工具返回结果随机遮盖掉一部分词就像在相纸上故意涂抹一些区域让它变模糊。然后模型要做的任务是看着剩余未被遮盖的内容猜出被遮盖的词是什么。在这个过程中模型能同时看到整段文本里所有未被遮盖的部分——包括出现在被遮盖词后面的那些字。回到刚才的退款例子。如果用MDLM来生成这个工具结果模型在生成退款是否成功、错误代码、处理结果这些字段时就能同时看到那个已经确定的status: error字段。于是它心里清楚这次调用以错误告终所以退款是否成功应该是false错误代码应该是某个具体的错误代号处理结果应该是需要重试或者联系用户之类的表述。整个输出在逻辑上是一致的、自洽的。这种能同时看到文本两端信息的能力在技术上被称为双向感知。传统大语言模型只能从左往右单向感知MDLM则能双向同时感知这就是两者在世界模型任务上产生差异的根本原因。MDLM还带来了另一个意想不到的好处生成多样性。传统模型在生成时一旦开头的几个词被确定了后续内容的走向就被严重限制了——这被称为前缀模式崩塌就像一个写手起了个特定开头就被迫沿着既有逻辑走到底。MDLM则不同它在生成时既可以从头部填词也可以从中间、从结尾填词生成顺序本身就是随机的。这种额外的随机性来源使得MDLM在多次生成时能产生真正多样化的结果而不是总围绕着几种固定模式打转。---**三、构建训练数据24万条真实轨迹的收集工程**为了让MDLM有足够的知识来模拟各种工具调用环境Patronus AI的团队耗费大量精力构建了一个专门的训练数据集。这个数据集的规模非常可观共计239,403条完整的状态—动作轨迹也就是AI助手完成一个任务过程中每一步的记录包括当前状态是什么、AI做了什么、环境返回了什么结果。这些轨迹来自九个不同的开源环境覆盖了软件工程代码修复与生成、深度研究自动文献搜索与整合、客户服务模拟客服对话、通用工具调用调用各类API完成任务等截然不同的领域。为了确保数据的多样性研究团队让12个不同的前沿AI模型来生成这些轨迹包括Qwen系列、GPT系列、Claude系列、Gemini、DeepSeek等主流模型。每个模型都有自己独特的思维方式和表达风格混合在一起后数据集里就包含了各种各样的推理路径、工具调用模式和错误恢复行为。数据处理环节同样颇费心思。研究团队专门对轨迹长度进行了多样化处理。对于超长的对话历史他们采用中间截断策略保留开头的任务描述和最后的若干轮对话把中间部分替换成一个占位符告诉模型这里有若干字符被截断了。这样一来模型就学会了如何在只看到部分历史的情况下做出预测——这在实际部署中非常重要因为真实的对话历史往往会超过模型的处理上限。更有创意的是环境状态接地环节。研究团队用Claude模型对每条轨迹进行分析生成一段事后诸葛亮式的指导说明如果我们早就知道最终结果那么预测这个结果需要哪些关键的环境信息这些信息被整理成结构化的说明包括数据库当前状态、任务奖励结构、相关工具的使用规范等然后附加到训练数据里。为了防止模型过度依赖这些说明大约20%的训练数据保持了无说明的原始状态。---**四、世界模型的五要素框架**在技术层面研究团队对文字世界模型给出了一个精确的数学定义但其核心思想可以用更直白的语言来描述。一个好的世界模型需要处理五类信息。第一类是初始环境状态也就是这次任务开始时这个虚拟世界长什么样——数据库里有哪些记录、文件系统里有哪些文件、用户账户处于什么状态。第二类是任务上下文包括用户的目标是什么、过去几轮对话说了什么。第三类是工具规范这次可以调用哪些工具、每个工具需要什么参数、会返回什么格式的数据。第四类是领域规则这个环境里有哪些不成文的限制和约定比如退款只能在特定条件下处理。第五类是导向指令这是这项研究特别强调的一个要素指的是对世界模型行为的高层次指导比如模拟一个工具调用失败的场景或者生成一个需要多步骤才能解决的复杂问题。这五类信息共同决定了世界模型应该生成什么样的下一个状态。传统方法往往只处理前三类而研究团队明确把可导向性作为设计目标——世界模型应该能够按照指定方向产生特定类型的场景这样研究人员就能根据AI的当前水平按需生成合适难度的训练场景。这五要素框架的另一个重要设计是初始环境状态由模型在内部追踪而不直接输出。这避免了每次预测都要重新描述整个世界的冗余模型只需要输出这一步之后世界有什么变化即可。---**五、比拼结果小身材大能耐**研究团队设计了一套严格的评测体系把MDLM和传统大语言模型在世界模型任务上做了全面比较。评测分为三个维度。第一个维度是生成质量模型生成的下一个状态和真实的下一个状态有多像研究团队使用了BLEU分数衡量词语重叠程度、ROUGE分数衡量最长公共子序列和MAUVE分数衡量整体文本分布的相似性三个指标。其中MAUVE分数最为关键因为它衡量的不是逐字的相似度而是生成结果和真实结果在语义空间里的整体接近程度。第二个维度是生成多样性同样的输入多次生成的结果有多不同使用Self-BLEU越低越多样和Distinct-N越高越多样来衡量。第三个维度是下游训练效果用这个世界模型生成的训练数据训练出的AI在真实环境里表现如何参与比较的模型阵容相当豪华。传统大语言模型一侧包括Qwen3.5-27B、GPT-OSS-20B、GLM-4.7-Flash、Nemotron-3-Nano-30B-A3B包含30B参数的混合专家模型和Qwen3.5-35B-A3B35B参数的混合专家模型。MDLM一侧包括WeDLM-8B、SDAR-8B、SDAR-30B-A3B和LLaDA-2.1-mini。所有模型都在同一份训练数据上进行了微调。零样本测试不给任何示例、直接让模型生成的结果显示MDLM在MAUVE分数上就已经普遍优于传统大语言模型。在API调用返回结果的预测任务上最大的MDLM的零样本MAUVE分数是0.697而表现最好的传统大语言模型只有0.532——差距相当可观。分析发现传统大语言模型在零样本场景下倾向于生成冗长的输出而API返回结果通常是简洁的JSON格式这种风格上的不匹配直接导致了分布差异。给传统大语言模型提供三个参考示例之后即三样本提示差距有所收窄部分传统模型在某些测试集上能接近甚至超过零样本的MDLM。但关键一步来了——当所有模型都经过微调后MDLM全面碾压传统大语言模型。最引人注目的数字是这个参数量只有8B的SDAR模型在核心测试数据集上的MAUVE分数达到了0.982而参数量是其四倍多、达到35B的Qwen3.5-35B-A3B只有0.932。换句话说一个小得多的MDLM在世界模型这个任务上打败了比它大四倍的传统大语言模型。多样性的比较结果同样支持MDLM的优势。在Self-BLEU指标上数值越低代表生成结果越多样SDAR-8B得到0.601而最好的传统大语言模型是0.659在Distinct-N指标上SDAR-8B是0.385传统模型只有0.228到0.321。这印证了之前的理论预测MDLM的随机去噪过程确实带来了更丰富的生成多样性。---**六、真正的考验在陌生环境里训练AI**评测世界模型的生成质量只是第一步更重要的问题是用这个世界模型训练出来的AI到底能不能在真实场景里有更好的表现研究团队选择了三个完全没有出现在训练数据中的测试环境。第一个是ScienceWorld一个文字型科学实验环境AI需要在十个相互连通的房间里导航拿取物品完成各种科学实验比如测量水的沸点、观察生物生长。第二个是ALFWorld一个家庭场景文字游戏环境AI需要在厨房、卧室等房间里完成捡起物品、把东西放到特定位置、清洁物品等任务。第三个是AppWorld一个模拟手机应用生态的环境AI需要调用Venmo、Spotify、邮件、日历等应用的API来完成用户交代的任务。这三个环境覆盖了截然不同的工具体系和任务类型而且完全是零样本转移——AI在训练时从未见过这三个环境的任何数据。研究团队分别测试了参数量从1.2B到7B不等的三个AI助手LFM2.5-1.2BLiquid AI开发、Qwen3-4B阿里巴巴开发和Mistral-7B-v0.3Mistral AI开发。训练方案分为四种完全不训练直接测试基础模型、只用监督学习微调用专家示例教模型、监督学习加上用传统大语言模型Qwen3.5-27B生成的世界模型轨迹做强化学习、监督学习加上用SDAR-8B生成的世界模型轨迹做强化学习。结果呈现出几个清晰的规律。在ALFWorld任务上LFM2.5-1.2B基础模型的成功率只有5.7%经过监督学习微调后提升到42.9%用传统大语言模型世界模型做强化学习后达到48.6%而用SDAR世界模型做强化学习后跃升至53.6%——相比最初的5.7%绝对提升幅度为47.9个百分点。对于Mistral-7B来说这个数字更令人印象深刻在ScienceWorld上从基础的3.3%一路提升至48.4%足足提高了45.1个百分点。在所有9对模型—环境组合中用SDAR世界模型训练的结果无一例外地优于用传统大语言模型世界模型训练的结果。两种世界模型之间平均相差5.3个百分点。鉴于这两个世界模型用的是完全相同的训练数据这个差距只能归因于MDLM本身更高的生成质量和多样性。---**七、人类专家说了什么**除了自动化评测研究团队还邀请了四位来自业界的独立专家对MDLM生成的世界模型输出进行了人工评估。这四位专家均拥有两年以上的LLM代理系统开发经验通过Upwork平台招募并经过了一个预筛选任务的考核才正式参与评估。评估的维度有三个。第一是真实性即生成的API响应看起来是否像真实的API响应。第二是结果正确性即模型预测的结果类型和关键事实是否正确。第三是训练效用即这个输出对于训练AI助手来说是否有价值——专家被要求从AI学习者的角度思考如果我是一个AI看到这个工具输出我能从中学到正确的行为模式吗四位专家独立打分使用1到5分的李克特量表。评估结果相当不错真实性平均分4.75结果正确性4.25训练效用4.50。更值得注意的是四位专家之间的一致性非常高——Krippendorffs alpha一种衡量评分者一致性的指标1.0代表完全一致0代表随机在三个维度上分别达到了0.932、0.891和0.901都远高于0.8这个通常被认为是高度一致的门槛。专家们还指出了一些值得称道的地方模型对导向指令的遵从度相当好尤其是当指令要求模拟特定的失败场景时模型能够可靠地生成符合预期的错误状态而不会无端生成成功结果。当然专家们也指出了几类反复出现的问题。最常被提到的是数字类型错误模型有时会把应该是整数的字段输出为字符串或者相反。还有就是API密钥格式错误生成的密钥看起来不像真实系统里会出现的格式。另一个值得关注的问题是错误级联如果一个工具在某一轮返回了错误模型会倾向于让后续所有工具也返回错误即使那些工具在逻辑上应该是成功的。研究团队认为这与麻省理工学院相关研究中观察到的多样本越狱行为有相似之处。---**八、哪些情况会让世界模型翻车**研究团队还专门设计了一组压力测试场景故意用各种刁钻情况来考验MDLM世界模型并与传统大语言模型做了对比。这些压力场景包括查询数据库时没有直接答案但有相邻信息需要推理信息不足以做出确定性决策需要表达不确定性工具返回结果非常冗长对生成模型的记忆和注意力提出挑战轨迹长度限制各不相同任务本身用现有工具无法完成以及需要跨多页翻页的分页查询需要准确追踪已经返回了哪些内容。观察到四个一致性规律。第一MDLM对于导向指令中的元素顺序基本不敏感——你把要求写前面还是写后面它都能理解这是双向感知带来的天然优势。但是当工具需要输出整个数据库状态这类极长文本时MDLM在没有重复惩罚的情况下会陷入重复循环一遍又一遍地输出相似内容。传统大语言模型虽然不产生重复但会开始输出没有根据的捏造内容。第二MDLM能够在参数空间里完成基础的数据库关联操作类似SQL里的JOIN并且能很好地维持整条轨迹内部的一致性适合状态追踪型任务。第三当任务对于现有工具来说根本无法完成时MDLM会继续生成合理的环境状态而不是直接中断或报错——这其实是个优点因为训练中需要AI探索各种可能性而不只是遇到死路就停下来。第四在高温度即生成随机性较高设置下MDLM偶尔会陷入块级重复——整段整段地重复相同内容。这个问题在更大的MDLM上明显减轻研究团队认为随着模型规模扩大会进一步改善。两个持续存在的局限性需要特别指出格式规范的API密钥生成问题研究团队推测这部分是因为基础模型Qwen3的安全对齐导致的以及分页工具的分页漂移问题模型不能准确追踪当前在第几页、已经返回了哪些记录。这两个问题目前只能通过精细调整导向指令来缓解根本解决还有待未来工作。---**九、一个被忽视的变量推理时想一想能补上差距吗**研究团队还做了一个有趣的附加实验给传统大语言模型开启思维链模式——让它在生成答案之前先想一想写出一段内部推理过程然后再给出最终答案。结果表明开启思维链确实能提升传统大语言模型的世界模型质量这印证了思维链能提升文本生成多样性的既有发现。然而代价是时间开启5000词的思维链预算后推理时间变为原来的3.75倍开启10000词预算后变为4.87倍。而MDLM在不需要任何思维链的情况下就能在质量上达到或超过开启思维链的传统大语言模型且推理时间和普通的传统大语言模型相当WeDLM-8B甚至比传统模型快0.68倍。这个对比揭示了一个关于效率的深层道理MDLM通过改变生成的基本机制来实现高质量而不是通过堆砌推理步骤。在需要大批量生成训练数据的场景下这种效率优势非常实际——用传统模型加思维链来生成24万条轨迹数据时间成本会高得多。---归根结底这项研究传递了一个简洁而有力的信息在让AI来模拟外部世界这个任务上阻碍大语言模型发挥的不是它的规模而是它从左往右、一条路走到黑的生成方式本身。换一种先打草稿、再双向修订的生成机制一个参数量只有传统模型四分之一的小模型反而能做出更连贯、更多样的世界模拟。这个发现的实际意义相当直接未来的AI助手训练可以越来越少地依赖人工搭建的固定练习场转而让世界模型按需生成各种情境随着AI变强而调整难度。对于普通用户来说这意味着你将来使用的AI助手会在一个更丰富、更接近真实世界的虚拟环境里练就本事遇到各种意外情况时不会轻易抓瞎。当然现阶段的MDLM世界模型还不是完美的环境替代品——分页追踪的问题、API密钥格式的问题在某些场景下还是会给训练信号带来噪声。研究团队坦诚地记录了这些局限并且特别提醒要留意AI可能会钻世界模型的空子来刷高奖励——换句话说AI可能会学会迎合世界模型的生成偏好而不是真正提升解决实际问题的能力。这个警告本身反映了世界模型研究领域一个尚待解决的根本问题当虚拟环境和真实环境之间存在差距时AI在虚拟环境里练出来的技能到底有多少能转移到现实Patronus AI的这项工作在这个问题上迈出了重要的一步但答案的全貌仍然在未来的研究中等待揭晓。对这个方向感兴趣的读者可以通过arXiv编号2607.16204v1查阅完整论文研究团队也已开源了数据集和训练代码供社区进一步探索。---QAQ1掩码扩散语言模型MDLM和普通的大语言模型在生成方式上有什么根本区别A普通大语言模型从左往右逐字生成每个词只能看到前面已有的内容。MDLM则不同它把目标文本里的一部分词随机遮盖掉然后同时参考整段文本中未被遮盖的所有内容来预测被遮盖的词包括出现在后面位置的词。这种双向感知能力让MDLM在预测需要全局一致的结构化输出如API返回结果时能避免传统模型常见的前半段说成功、后半段说出错的矛盾现象。Q2GRPO是什么类型的训练方法为什么这篇论文要把它和世界模型结合起来AGRPO是一种强化学习算法让AI通过不断尝试、获得反馈、调整策略来提升表现类似于通过反复练习来提高技能。传统GRPO需要真实环境来提供反馈但真实环境往往数量有限、难以扩展。把世界模型接入GRPO流程相当于给AI提供了一个随时可用的虚拟练习场可以按需生成各种情境让AI在完全陌生的任务上也能大量练习这就是为什么用世界模型训练的AI在新环境里能提升最高47个百分点的原因。Q3SDAR和WeDLM这两个MDLM模型分别是什么它们在这项研究里有什么不同表现ASDAR和WeDLM都是把已有的大语言模型基于Qwen3-8B改造成掩码扩散模式的模型都属于8B参数规模。两者的主要区别在于推理机制SDAR使用块扩散方式默认块大小为4WeDLM使用窗口式扩散默认窗口大小为6并且在推理速度上比传统大语言模型快约2.5倍。在生成质量测试中SDAR-8B的综合表现略优于WeDLM-8B而在推理速度上WeDLM-8B更有优势。研究选用SDAR-8B作为下游强化学习训练的主要世界模型。