理解与生成一体化:多模态大模型的自回归路线怎么走

📅 2026/8/7 16:09:26
理解与生成一体化:多模态大模型的自回归路线怎么走
本文整理自 QCon 北京 2026《王耀明 - 理解与生成一体化统一多模态大模型的自回归路线》通过AI音视频总结工具Ai好记视频转文字整理以下为精炼整理后的会议笔记内容。图像理解要看清细节图像生成要留住细节这两个目标在一个模型里往往打架。王耀明在 QCon 北京 2026 的分享里提出的是一条Decoder-only 纯自回归路线扔掉传统视觉编码器直接吃图像原始 Patch再用模态混合专家MoE动态调度能力让理解与生成两种任务在同一套模型里共存并互相促进。这篇把架构、训练范式到工程优化完整整理出来。一、核心矛盾为什么理解与生成老打架传统多模态模型大多是 ViT LLM 的后融合结构这里藏着一个信息瓶颈。视觉编码器ViT在提取高层语义信息时会丢图像浅层的细节信息比如纹理、边缘而这些恰恰是图像生成最需要的。再加上把视觉特征通过 MLP 投影到语言空间大规模训练下泛化能力有限很难兼顾高质量的图像生成。结果就是理解好的模型生成不行生成好的模型理解费劲一个模型很难两头都最优。二、架构创新Decoder-only 纯自回归路线针对这个矛盾演讲给出的解法很彻底移除独立的视觉编码器。图像不再经过 ViT只做一层简单的 Patch Embedding 就直接送进模型把所有几何和纹理信息原样保留。模型本身是一个 Decoder-only 的 Transformer 骨干靠内部的 MoE 专家动态地、任务驱动地去学习理解任务时提取语义特征生成任务时提取细节特征。这样就从结构上避免了前置编码造成的信息损失和任务冲突。三、模态 MoE 架构能力模块化、任务自适应支撑这套路线的关键是模态混合专家MoE架构。它把模型能力模块化共享模态专家池提供基础能力比如理解、生成、细粒度专家稀疏专家池提供专项能力。通过路由机制模型会根据输入任务自动激活不同的专家组合。比如「描述这张图」和「生成一张猫的图片」是两种截然不同的需求路由会调度不同的专家来应对。同一套模型参数就能高效灵活地服务于截然不同的模态任务。四、训练范式多阶段深度融合理解与生成一体训练上也不能各自为政。演讲设计了一套多阶段训练策略专家预训练先把各专家模块单独练好参数全开的联合训练放开全部参数一起训练交错理解生成数据训练这是关键用「先生成图像再对生成图像做理解描述」这类交错序列数据在同一个前向传播里把生成结果和语义理解深度关联起来强化学习后训练进一步对齐和优化。交错理解生成训练的意义在于它打破了理解与生成任务在传统训练里的隔离让两种能力在联合优化中相互增强而不是简单并列。五、工程优化MoE 训练怎么提速MoE 架构带来了巨大的通信开销和复杂的并行计算自回归图像生成又是 Token 逐个预测、计算密集。演讲给了几个关键解法三级正交混合并行策略数据并行、模型并行、专家并行分层组合通信计算重叠优化用 NVLink / RDMA 让通信和计算重叠减少等待ExpertGEMM 融合计算把专家矩阵乘法融合起来减少开销KV Cache 优化 异步 Rollout利用自回归生成的确定性提升吞吐量。工程上把 MoE 和自回归生成的效率问题处理好了整套方案才能真正落地。六、核心优势与未来展望这套架构带来的优势很明确原生支持任意分辨率不用裁图缩放理解与生成两端都达到同尺寸模型的 SOTA展现出图像编辑、风格迁移等涌现能力推理效率更高。至于未来演讲的判断是多模态模型的方向在视觉中心的推理VLA、视频层面的理解与生成相互促进甚至可能在视频「世界模型」里找到类似文本那样高效的自监督预训练钥匙。落地思考对做多模态、生成式 AI 的团队来说这场分享的价值在于一个视角转换不要在「加一个更强编码器」上内卷而是回到信息本身让模型直接看到原始像素再靠 MoE 按任务调度能力。这是一个挺有启发的架构思路。几十分钟的硬核演讲信息密度高我习惯用 Ai好记 转成图文笔记它会自动生成精华速览和思维导图把 MoE 架构、训练范式、工程优化这些关键点结构化地抓出来事后对照翻查方便得多。做技术学习笔记这套工作流很顺手。FAQ统一多模态自回归路线高频问题Q传统 ViT LLM 结构的主要缺陷是什么A视觉编码器会丢失浅层细节信息纹理、边缘而这些对图像生成很重要导致理解与生成在特征粒度上天然矛盾难以在同一模型里同时最优。QDecoder-only 纯自回归路线怎么解决这个矛盾A移除独立视觉编码器图像只做 Patch Embedding 直接进模型保留全部原始信息靠内部 MoE 专家按任务动态提取理解语义或生成细节特征。Q模态 MoE 架构起什么作用A把能力模块化通过路由机制根据任务自动激活不同专家组合让同一套参数高效服务理解、生成等不同模态任务。Q交错理解生成训练有什么意义A打破理解与生成训练的隔离用「先生成再理解」的交错数据在同一个前向传播里深度关联两种能力实现相互增强而非简单并列。QMoE 架构工程上最大的挑战是什么A通信开销大、并行计算复杂、自回归生成计算密集。解法是三级正交混合并行、通信计算重叠、ExpertGEMM 融合等。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。