机器人世界模型三类分类详解 📅 2026/7/22 9:04:24 机器人世界模型三类分类详解Robotics 里「世界模型World Model」几乎成了万能标签视频生成、物理仿真、机器人策略都能被这么叫。**NVIDIA Cosmos 3 技术报告2026 年 6 月**给出一套可落地的三层划分——Video World Model → Action-Conditioned World Model → World Action Model——按输入/输出是否含 Action、输出是否为可执行控制拆开「看未来」「懂因果」「会出动作」三条线便于对照各家产品到底落在哪一层。速览VWM视频世界模型条件生成未来视频/画面底座多为视频生成模型。AWM动作条件世界模型给定动作含语言指令预测环境如何变化偏仿真/前向动力学。WAM世界动作模型直接生成机器人动作常兼未来视频本质是带世界预测的Policy与口语中的VLA大量重叠、分类轴不同。分家口诀看Action 在条件侧还是输出侧主交付是视频/数据还是可执行控制。原文Cosmos 3 Technical Report机器人学习视角MARS Lab 综述。目录1. 为什么需要分类2. 形式化 I/O三层怎么记3. 三层分类总表4. 第一层Video World ModelVWM5. 第二层Action-Conditioned World ModelAWM6. 第三层World Action ModelWAM7. WAM、VLA 与 Policy同一片海域的不同切法8. 演进关系、决策树与经典「世界模型」对照9. Cosmos 3 与「全能模型」10. 原文与延伸阅读1. 为什么需要分类同一词至少覆盖三类能力口语里的「世界模型」实际在干什么像 Sora / Veo 一样生成视频视觉层面的未来推演像仿真器一样动作→环境变化学习物理因果像 VLA 一样观测→关节角/轨迹直接输出控制策略不分类会导致把视频生成 Demo当成可部署机器人策略或低估DreamDojo 类仿真器在数据合成里的价值。Cosmos 3 报告按I/O 是否含 Action、输出是否可执行划三层与产业侧常见用法一致。2. 形式化 I/O三层怎么记用统一符号记示意不绑定某一论文的记号符号含义(c)非动作条件文本、图像、视频提示等(o_t) / (s_t)观测或状态(a_t)动作关节、末端、夹爪语言指令也可视为一种 action(v_{t1:T})未来视频/帧序列层条件输入模型主预测输出一句话VWM(c)偶尔含历史帧(v_{t1:T})续写/想象画面AWM(s_t)或 (o_t) (a_t)(s_{t1}) 或 (v_{t1})「我若这样动世界怎样变」WAM(o_t) 目标/语言(a_t)± 未来视频「我该怎么动」分家关键Action 在左边条件还是右边输出。AWM 吃动作、吐世界WAM 吃世界观测、吐动作。先进系统常两边都有归类看主任务与主损失优化的是世界预测误差还是控制/模仿成功率。WAM观测 o动作 a可选未来视频AWM状态 动作 a未来状态/视频VWM条件 c未来视频3. 三层分类总表层级英文名中文核心 I/O典型代表归属随公开表述可能漂移1Video World Model (VWM)视频世界模型文本/图像/视频 →未来视频GoogleVeo、阿里Wan通义万相、NVIDIACosmos 3视频生成配置2Action-Conditioned World Model (AWM)动作条件世界模型动作或语言→ 未来状态/视频NVIDIADreamDojo、GoogleGenie、Meta FAIRJEPA-WM3World Action Model (WAM)世界动作模型观测 →动作 可选未来视频NVIDIADreamZero、蚂蚁LingBot-VA、GoogleUniPi其它命名如mimic-Video等不先背品牌先看主输出是视频还是可执行动作。公开材料把同一产品同时说成「世界模型」和「策略」时以该 checkpoint 的默认推理图为准。加入动作条件输出可执行控制第三层 WAM观测 → 机器人动作 Policy第二层 AWM动作 → 环境变化第一层 VWM预测未来画面4. 第一层Video World ModelVWM定义底座是视频生成模型——根据文本、图像或其它条件生成视频即对未来视觉状态的估计。要点说明能力未来帧预测、场景想象、合成训练数据、演示视频局限默认不直接输出关节角、夹爪指令代表Veo、Wan、Cosmos 3在 Text/Image → Video 模式下维度VWM典型数据大规模互联网/具身视频弱标注或文本对齐常看指标FVD、CLIP 类一致性、主观物理伪影穿透、动量荒谬常见坑「好看」≠「可当仿真」无动作条件时难做反事实「若换动作会怎样」NVIDIA 将Cosmos 3放进 VWM 语境因其是Physical AI 通用底座可按配置只做世界生成相对单一任务视频模型更强调多模态统一架构见 §9。5. 第二层Action-Conditioned World ModelAWM定义在给定动作条件下生成世界演化——预测「我做这一步世界会变成什么样」。要点说明输入物理动作关节、末端位姿或语言指令视为 action输出未来视频/状态偏前向动力学 / 世界仿真代表DreamDojo世界仿真器、Genie、JEPA-WM与 VWM生成以动作为条件强调因果而非纯视觉续写。与 WAM主输出仍是世界预测动作是输入条件不是或不主要是策略输出。维度AWM典型数据动作–观测轨迹对真机遥操、仿真 rollout、带控制信号的视频常看指标开环/闭环预测误差、物理一致性、反事实合理性、用于下游策略时的提升常见坑仿真里「因果正确」≠ 真机可迁移动作空间与本体未对齐时条件失效Genie / JEPA-WM 等在不同论文世代里能力边界不一有的偏交互式环境生成有的偏表征与预测。归类时仍问推理时是否必须提供 action、主输出是否仍是世界而非控制。6. 第三层World Action ModelWAM定义模型直接生成机器人动作并常联合预测未来图像/视频——把「理解世界」和「怎么动」绑在同一套生成/预测框架里控制输出成为一等公民。要点说明关注点具身里怎么响应、怎么操作代表DreamZero、LingBot-VA、UniPi产业热度投资与论文当前最集中的一层Cosmos 3 报告将Video Text → Video | Action等配置映射为 world action / policy model for robot learning与 WAM 一致。维度WAM典型数据演示、遥操、RL/离线数据集常要本体、相机标定与动作规范一致常看指标真机/仿真任务成功率、分布外泛化、安全性与干涉率若兼生成视频再看预测质量常见坑Demo 成功率当部署指标忽略延迟、力控与失败恢复「带视频头」不等于已通过物理一致性验收7. WAM、VLA 与 Policy同一片海域的不同切法叫法强调的轴典型联想Policy决策(o \mapsto a)古典 RL/模仿学习VLA模态Vision–Language–Action 对齐RT-2、OpenVLA 等叙事WAM世界建模 动作常联合未来视频/状态与动作Cosmos 谱系、部分「世界动作」论文关系可以记成WAM ⊂ 广义 Policy输出必须是可执行动作。多数具身 VLA 在 I/O 上可归进 WAM 这一层观测语言 → 动作是否「世界模型」取决于是否显式做未来预测/动力学还是纯行为克隆。营销上的 VLA 与报告里的 WAM不是互斥 SKU而是不同切片立项时写清主输出与是否联合预测世界比争论商标更重要。大量重叠广义 PolicyWAM常带世界预测的策略VLA强调 V-L-A 对齐8. 演进关系、决策树与经典「世界模型」对照维度说明技术递进看未来VWM→ 懂因果AWM→ 会决策WAM工程选型数据合成、仿真预训练多在前两层真机部署策略多盯 WAM / VLA边界模糊先进模型常同时吐未来视频与动作归类看主损失与主交付物选型时固定问三句主交付物是视频/数据还是可执行 actionAction 是输入条件还是模型输出要真机闭环还是离线仿真/合成否否是是主交付是可执行动作?需要动作条件做因果预测?偏 VWM生成/想象偏 AWM仿真/前向模型偏 WAM / VLA策略与经典 RL「世界模型」的半页对照经典 RL World Model如梦境训练一脉本文 Robotics 三层Cosmos 语境语境智能体在学习到的动力学里做规划/想象 rollout视频生成、动作条件仿真、具身策略统一叫「世界模型」输出多为下一状态/奖励预测服务规划或策略学习VWM 可无动作WAM 直接出控制易混点「有世界模型」≠「能生成好看视频」「能生成视频」≠「可部署 policy」两套词同源、应用面不同读论文时先标它属于RL 规划栈还是视频/具身生成栈。9. Cosmos 3 与「全能模型」Cosmos 3: Omnimodal World Models for Physical AINVIDIA2026 年 6 月不单属某一层同一Mixture-of-Transformers架构下换输入/输出模态组合可在 VLM、视频生成、AWM、WAM 等模式间切换。能力块在栈中的角色Cosmos 3 Reasoner多模态理解、物理推理Cosmos 3 Generator视频/图像/音频生成Action tokens连接语言、视频与物理控制信号DreamDojo / DreamZero报告中作为 AWM / WAM 实例讨论把 Cosmos 3 放在 VWM 类指的是其视频世界生成底座完整报告强调的是三层能力进同一框架。评估某个 Cosmos 配置时仍回到 §2 的 I/O 表而不是只看品牌名。10. 原文与延伸阅读10.1 Cosmos 3资源链接Technical ReportPDF官方 PDF · 本地副本项目页https://research.nvidia.com/labs/cosmos-lab/cosmos3/Hugging Face Papershttps://huggingface.co/papers/2606.02800代码与权重https://github.com/NVIDIA/Cosmos开发者博客https://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3/10.2 机器人学习视角综述资源说明World Model for Robot Learning: A Comprehensive Survey南洋理工MARS Lab等本地 PDF项目页 / Awesome 列表持续更新的论文与资源落地时注意模型命名与层级随厂商宣传变化同一 checkpoint 可能支持多种 I/O 模式。评估以主任务指标生成质量、仿真物理一致性、真机成功率为准而非是否自称「世界模型」。真机侧还要单独验收延迟、安全与失败恢复——那是策略部署问题不是视频指标能替代的。收束先固定 I/O——Action 在左还是在右主输出是世界还是控制——再谈 VWM / AWM / WAM。与 VLA 的争论多半是切片不同与经典 RL 世界模型的混淆多半是语境不同。会叫名字不如会写验收指标。