清华VPP2登顶RoboDojo凭预测解耦突围GPT-6目录一、导语二、先说清楚VPP2 是什么RoboDojo 又是什么三、它赢在哪14B 模型靠预测-动作解耦突围四、榜单实测VPP2 把谁甩在身后五、现在就能跑开源复现 VPP2六、冷静视角登顶之外三盆冷水总结一、导语2026年10月8日清华系具身公司星动纪元RobotEra在 GitHub 宣布其自研的世界动作模型 VPP2Video Prediction Policy 2登顶 RoboDojo-Sim 官方榜单以 39.26 分、32.26% 平均成功率拿下综合第一并在泛化、精细操作、记忆等维度领先把上个月刚跨界登顶的 GPT-6-Astra、以及 Physical Intelligence 的 π0.5、英伟达 GR00T-N1.7 等一众头部模型甩在身后。更扎眼的是这是一个只有 14B 参数、不靠额外数据、不开外挂增强、且完全开源可复现的模型——性能提升不是靠堆料或刷分而是来自预训练基座本身的泛化。二、先说清楚VPP2 是什么RoboDojo 又是什么先把两个容易被名字劝退的概念拆开。VPP2 属于世界动作模型WAMWorld Action Model。这个名字要和两类更常说的模型区分开VLA视觉-语言-动作模型比如英伟达 GR00T把看到什么 听到什么指令直接映射到该做的动作本质是反应式控制。它语义理解强但大多不显式建模世界的物理演变。世界模型World Model比如星动纪元自己 2 月登顶 WorldArena 的 Ctrl-World学的是如果这么做世界会变成什么样本身是模拟器/规划器并不直接输出机器人策略常用来批量造训练数据。世界动作模型WAM把预测未来状态和生成可执行动作耦合进同一个策略框架目标不是只想象而是想象完直接动手。VPP2 走的是Cascaded级联路线——先想清楚未来会怎样再据此解码动作而不是把视频和动作一锅炖。多说一句 WAM 内部的两条技术支线。同样叫世界动作模型有的走Joint联合路线——视频预测和动作决策共享同一套参数、端到端一起训有的走 VPP2 这种Cascaded级联路线——先独立把视频预测器训扎实再外接一个动作专家。Joint 看似更原生但实践中动作噪声极易回灌污染视频表征导致看不准 → 做不对的连锁崩塌Cascaded 用显式解耦换来了模块独立优化的空间代价是多一道接口工程。VPP2 选 Cascaded本质上是用工程上的分步可验证去换训练上的稳——视频预测器可以先单独评测、单独迭代确认眼睛够准了再谈手的事。图二VLA / 世界模型 / 世界动作模型 三者区别RoboDojo 又是什么它是一个由香港大学 MMLab罗平教授、陈天行博士牵头联合 UC 伯克利、清华等全球近 20 所机构共建的统一评测基准背后是 RoboTwin 原班人马被业内戏称为具身智能界的珠穆朗玛峰。它干的事用一句话概括给全世界的机器人模型办一场统一高考——过去各家发 Demo、报成功率但考卷不同、硬件不同、评分标准不同横向比较几乎无从谈起RoboDojo 把 42 个仿真任务、18 个真实机器人任务、30 个主流策略模型塞进同一套评分覆盖泛化、记忆、精细操作、长程执行、开放语义理解五大能力。这五个词各有实指泛化考换个物体、挪个位置还灵不灵记忆考长任务做到一半还记不记得前置状态精细操作考东西摆歪了还能不能抓准长程执行考连续多步不跑偏开放语义考听懂模糊自然语言指令。也正是因为这套卷子专挑机器人不擅长的地方出题想靠刷熟练度蒙混过关基本没戏。三、它赢在哪14B 模型靠预测-动作解耦突围VPP2 最反直觉的地方在于它没去卷参数量也没在测试时偷偷加数据或接 Agent 增强Agent RSI 这类手段没用而是把功夫花在了一条更朴素的技术路线上——先把视频预测练到足够强再让机器人真正动起来。具体是一条三阶段的训练流水线图三VPP2 三阶段训练流程——练眼、提速、练手事件级视频预训练练眼在覆盖完整操作轨迹的大规模视频上继续预训练底层的 Wan2.1-14B 视频模型并给片段打上详细文字描述目标是先得到一个能泛化到开放任务的可信视频预测器而不是急着出动作。单步视觉规划提速把事件级片段切成固定时域的视频块后训练并引入一致性蒸馏Consistency Distillation把原本需要多步迭代去噪的生成过程压成单次前向出结果为实时闭环清掉速度障碍。动作学习练手最后才引入一个仅 0.9B 参数的动作专家用混合 TransformerMoT架构学习隐式逆动力学根据视频预测反推该执行的动作动作模块全新初始化、全程保留视频表示从而注入动作能力时不破坏前面练出的泛化性。这条路线的针对性很强。世界动作模型一道老大难是预测错了动作就跟着错。如果视频和动作从一开始就搅在一起训动作噪声会反过来污染本就不稳的视频表征导致泛化崩塌。VPP2 反过来——先让眼睛在大量无动作标注的视频上把世界动力学学扎实再单独接一个轻量手于是视频预测和动作生成两种泛化被一起拉升。论文里的两组数字能说明问题在开放任务的视频预测指令跟随成功率上VPP2-14B 比 Cosmos3-64B 高 11.0 个百分点在真实零样本 ALOHA 操作任务上比最强基线高 18.5 个百分点。换句话说基座视频模型练得越准下游动作就越不容易想错导致做错。单步蒸馏这一步对真机部署尤其关键。机器人控制讲究闭环时延——如果每一步都要视频模型迭代去噪几十次才能出预测等想清楚的时候手早就抖了。VPP2 把生成过程压成单次前向等于把思考的时间成本降到了和反应式 VLA 同量级却保留了预测式模型的泛化优势。代价是蒸馏会损失一点视频保真度但动作专家只取视频里的语义和时序线索、对像素级细节并不敏感所以这点损失在动作维度几乎无感。这也解释了为什么它能在不接 Agent 外挂的前提下还跑得动实时闭环省掉的不是模型能力而是推理链路上的冗余计算。此外VPP2 还用一个 VLM 承担分层高层规划面对收拾餐桌这类模糊的长任务VLM 把它拆成一串详细子任务描述再依次交给动作专家——VLM 管推理、语义和记忆动作专家管底层执行。这种预测-动作解耦 分层规划的组合正是它不靠额外数据也能泛化的根因。把视野拉回清华系的技术脉络这条解耦思路同星动纪元 2 月登顶 WorldArena 的 Ctrl-World 世界模型其实一脉相承前者擅长造出高保真的虚拟训练场后者擅长在虚拟里想清楚后直接动手同一个人马把会想象和能动手两件事都推到了头部。Ctrl-World 当时在 WorldArena 具身任务上拿下全球第一四大维度全部登顶——主体一致性 0.8411、轨迹精度 0.4766、深度精度 0.9300、策略评估 Pearson 相关系数 0.986而同期英伟达同类方案在策略评估一栏只有 0.483。也就是说星动纪元先把让世界模型会想象、且想象得可信做到头部再用 VPP2 把想象完能落地动手也补齐。这比单篇登顶更能说明团队的技术连续性和数据飞轮的扎实程度。四、榜单实测VPP2 把谁甩在身后把 VPP2 放进 RoboDojo-Sim 的同一张考卷里看差距是量化的。更新后登顶的那一版VPP2 拿到 39.26 分、32.26% 平均成功率综合第一在泛化、精细操作、记忆等维度也都居首。排名模型类型机构得分 / 成功率1VPP2WAM星动纪元清华系39.26 / 32.26%2PhysicalRSIAgentVLAHKU MMLab KAI36.27 / 31.38%3Awomo-0.5WAMAwomo35.34 / 29.64%4Simate-betaVLASimate33.95 / 27.96%9GPT-6-AstraAgentRoboDojo Team28.97 / 22.48%图一RoboDojo-Sim 主要模型得分对比VPP2 登顶几个读数值得记一下第一被甩开的不只是传统具身公司——上个月刚跨界来考机器人、引发通用大模型下场抢饭碗讨论的 GPT-6-Astra这次掉到了第 9第二VPP2 是榜上少有的开源 无额外数据 无 Agent RSI夺冠模型意味着它的分数不是测试期工程堆出来的第三它击败的对手里既有 WAM 同赛道Awomo-0.5也有 VLA 和 Agent 路线说明预测-动作解耦这条路线在当前考卷上暂时压过了直接映射和接外部推理。不过也要看清榜单按平均得分排序VPP2 在长程执行、开放语义这两个维度并非第一它的领先主要来自泛化、精细操作与记忆——这恰好对应它视频预测强 → 动作泛化强的技术长板。“综合第一不等于每个维度都第一”这个结构反而值得工程团队记下来如果你的场景是同一张桌子换个不同形状的物体去抓VPP2 的高泛化红利最容易吃到如果你的场景是听一句模糊自然语言指令、连续干十分钟家务那它还远没到能独当一面。换句话说选模型不能只看榜单名次得先看自己的任务落在五个能力里的哪几格——VPP2 当前最强的三格泛化、精细操作、记忆恰好对应视频预测长板 → 动作泛化外溢这条因果链而它没拿首的两格长程、开放语义恰恰更吃持续推理与抽象规划这部分的差距不是换基座能立刻补上的。五、现在就能跑开源复现 VPP2VPP2 是开源的代码 MIT 许可模型权重上 Hugging Face 与 ModelScope官方仓库roboterax/video-prediction-policy-2自带 RoboDojo、LIBERO 等评测脚本。想自己复现这次登顶有两条路。路径一官方完整复现带环境# 1) 克隆并建环境Python 3.10gitclone https://github.com/roboterax/video-prediction-policy-2.gitcdvideo-prediction-policy-2 conda create-nvpp2python3.10-yconda activate vpp2 pipinstall-rrequirements-train.txt-cenvironment-reference.txt# 2) 取权重Hugging Face 公开ModelScope 需账号# Haodong082399/VPP2 下包含 RoboDojo 的 Video / Action 配对 checkpoint# 3) 跑 RoboDojo 闭环评测configs/robodojo/ 下配置python tools/eval_robodojo.py--configconfigs/robodojo/eval.yaml\--video_ckptVideo权重--action_ckptAction权重\--outputpredictions.jsonl路径二只看架构、不跑全量评测显存或数据不够时可以先把论文的三阶段流水线当成设计模板读用一份事件级操作视频做视频预测继续预训练 → 一致性蒸馏成单步规划 → 接一个小型 MoT 动作专家。哪怕不训机器人这套先练预测、再解耦注入动作的顺序对做视频生成或仿真数据引擎的人也有参考价值。读代码时建议重点看三处event_level_pretrain的数据组织方式、consistency_distill的单步蒸馏损失、以及action_mot里动作专家如何只接视频表示而不重训主干。对资源有限的团队直接复现 14B 的视频预训练不现实但三阶段解耦的思路可以降维借用用你手里已有的操作视频先只做视频预测继续预训练即便 backbone 小几号再把动作模块做成可插拔的轻量专家而不是一上来就端到端硬训。这样做有两个实在的好处——视频预测器能独立评测、单独迭代动作模块坏了也能单独换同时视频侧积累的数据和表征未来还能复用到仿真数据合成、异常检测等别的任务上投入不是一次性的沉没成本。换句话说VPP2 给中小团队最大的启发可能不是去买 14B 算力而是把预测和动作切开训这个工程顺序本身。跑的时候重点看三件事泛化维度换个物体/场景还灵不灵、记忆维度长任务中途是否还记得前置状态、以及单步蒸馏后的推理时延——这三项是 VPP2 这次真正拉开的差距也是它能不能落地到真机的关键。六、冷静视角登顶之外三盆冷水VPP2 的登顶值得记一笔但把它放回整个领域看有三处得降温。榜单整体水位还很低。RoboDojo 公开资料显示当前最强模型在仿真任务平均成功率仅约 8.8%、真实世界任务最高约 12.8%而人类专家分别是 76.03% 和 100%。换句话说VPP2 拿的是矮子里拔将军的第一距离机器人真能干活仍有数量级差距把它读成具身智能已经通关是严重的过度解读。“登顶 GPT-6不能简单读成具身超越通用大模型”。GPT-6-Astra 在 RoboDojo 走的是 Agent 路线外接推理和 VPP2 的端到端 WAM 路线考核重点不同一个是派一个会思考的代理去考一个是让模型自己动手考直接比名次容易误导。更稳妥的解读是在统一高考的同一张卷子上当前 WAM 路线在动手类任务上暂时占优而非通用大模型被击败。开源 ≠ 真机落地时延仍是坎。VPP2 的优势建立在大量视频预训练与单步蒸馏之上但 WAM 类模型在推理时延、3D 空间精度单目视频训练带来的深度偏差、跨本体适配上仍有公认短板。论文也只承诺了仿真与有限真机零样本结果距离工厂、家庭这类非结构化现场的稳定部署中间还隔着数据、本体和安全的长链条。第三盆冷水之外还要补一句关于基准本身的提醒。RoboDojo 把 42 个仿真任务、18 个真实任务、30 个策略塞进同一套评分价值在于终于有了可横向比较的考卷但考卷的设计天然偏向它列出的五大能力并不覆盖具身落地要面对的全部麻烦本体异构、安全合规、长周期维护都不在分数里。所以既不能因为一次登顶就神话某个模型也不能因为真机只有 12.8%就否定它的意义——它至少把谁的基座更会泛化这件事量化了出来给后来者一个明确的追赶靶子。把时间轴拉长看清华系星动纪元在两条赛道上的连续登顶更有意思2 月 Ctrl-World 在 WorldArena 拿下世界模型具身任务全球第一10 月 VPP2 又在 RoboDojo 拿下世界动作模型第一。同一个团队先把让机器人会想象做到头部再把想象完能动手也做到头部——这比单篇登顶更能说明具身智能的竞争正在从Demo 谁更炫转向谁的基座更会泛化、谁的数据飞轮更扎实。总结VPP2 是清华系星动纪元推出的世界动作模型以 14B 参数、不靠额外数据与外挂增强、完全开源的姿态登顶 RoboDojo-Sim把 GPT-6-Astra、π0.5、GR00T 等头部模型甩在身后。它的核心不在堆料而在先练视频预测、再解耦注入动作的三阶段路线——用预测-动作解耦换来了真正的零样本泛化。对做具身智能和仿真数据引擎的团队这是一份可复现、可拆解的样本但也要看清榜单整体水位仍低、路线对比不宜神化、真机落地还早。下一步值得盯的是当更多团队采纳预测-动作解耦这条路线WAM 能否把那一纸 12.8% 的真实世界成功率真正往上推。