26年7月来自阿里达摩院、香港具身智能实验室、港中文大学和湖畔实验室的论文“RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation”。在开放世界中进行机器人操作不仅需要识别场景外观还需要预测其三维结构在交互作用下的运动变化。同步的 RGB、深度和光流RGB-DF数据提供一种具有物理意义的表征能够捕捉场景内在的四维4D动态特性。与传统的二维像素视频相比这种多模态协同机制将视觉外观、几何结构与时间维度上的运动有机结合构建出的表征空间更贴近机器人系统所需的底层末端执行器动作从而缩小世界预测与策略学习之间的鸿沟。基于这一洞察提出 RynnWorld-4D一个生成式模型能够在统一的扩散过程中仅根据单张 RGB-D 图像和语言指令同步生成未来的 RGB 帧、深度图和光流信息。该 4D 世界模型采用三分支架构融合跨模态注意机制与逐帧 3D 旋转位置编码RoPE确保外观、几何形态与运动演变的一致性。如图1 所示给定输入的 RGB-D 图像和描述RynnWorld-4D 同步生成 RGB、深度和光流视频这些视频可进一步提升为 3D 场景流右图。为了提供大规模训练数据构建 Rynn4DDataset 1.0一个包含超过 2.544 亿帧图像的海量数据集其涵盖以第一人称视角egocentric拍摄的人类与机器人操作视频并附带高质量的深度与光流伪标签。此外还提出 RynnWorld-4D-Policy这是一个逆动力学预测头它利用 RynnWorld-4D 的内部 4D 表征仅需单次前向传播即可输出机器人动作从而绕过耗时的多步去噪过程实现闭环控制。如图2 所示Rynn4DDataset 1.0 数据集的构成其提供一个包含 2.544 亿帧的大规模混合数据集其中平衡了人类以自我为中心的视角视频与多样化的机器人操作数据。这种多样性确保了世界模型既能学习通用的物体交互先验知识又能学习机器人特有的执行轨迹。1 Rynn4DDataset 1.0为了填补大规模 4D 训练数据的空白其推出 Rynn4DDataset 1.0。这是一个混合数据集包含来自以人为中心的数据集如 Epic-Kitchens [Damen et al., 2020]、EgoVid [Wang et al., 2024]和机器人操作数据集如 RoboMIND [Wu et al., 2024]、RDT-1B [Liu et al., 2024]、Galaxea [Jiang et al., 2025b]、RoboCoin [Wu et al., 2025b]、AgiBot [Bu et al., 2025]的超过 2.544 亿帧视频数据。每一帧都配备高质量的 4D 伪标注信息细粒度指令Bai et al., 2025、单目深度Lin et al., 2025以及稠密光流Morimitsu et al., 2025。Rynn4DDataset 1.0 的统计数据与构成情况如上图 2 所示多模态标注流程如图 3 所示。视频描述生成Video captioning。利用 Qwen3-VL (Bai et al., 2025) 为视频数据Damen et al., 2020; Wang et al., 2024; Wu et al., 2024; Liu et al., 2024; Jiang et al., 2025b生成描述文本。具体而言利用该模型强大的视频-语言理解能力针对每个视频片段生成详细且结构化的描述。视频首先以 1 FPS 的帧率进行采样并被分割成时长为 5 秒的片段。对于每个片段向模型提供以下提示词prompt“请详细描述这段视频内容应涵盖以下方面视频中的主要对象及动作。环境与背景。任何物体及其相互作用。整体场景氛围和情境。请用一段话简洁明了地描述这段视频。”生成过程设定最大输出长度为 512 个 token温度参数temperature设为 0.7以平衡创造性与连贯性。生成的描述文本随后被收集并以 JSON 格式存储供后续任务使用。光流标注。采用 DPFlow (Morimitsu et al., 2025) 这一先进的光流估计模型。对于每段视频按顺序处理原始分辨率下的帧对利用颜色编码将估计出的光流场可视化并将其保存为帧率为 25 FPS 的 MP4 视频。深度标注。采用 Depth Anything 3 (Lin et al., 2025)具体使用 DA3NESTED-GIANT-LARGE-1.1 检查点checkpoint该模型可提供逐帧的密集深度预测及相机位姿估计。每段视频以 30 FPS 采样并在 392 像素短边上限缩放的工作分辨率下进行处理。为了将估计的深度图转换为可观看的深度视频加载压缩后的深度数组并利用双线性插值将每一帧上采样至原始视频分辨率。深度值被截断至 [0.0, 5.0] 米的全局范围并通过公式 I ⌊d/d_max × 255⌋ 量化为 8 位灰度值。最终生成的帧被保存为 RGB 视频。2 基于多模态视频的3D场景重建RGB-DF即RGB、深度和光流表示的一个关键优势在于其固有的几何可解释性。通过结合同步生成的深度与光流信息可以重建时间上一致的3D场景并推导出度量场景流metric scene flow。几何反投影。给定第t帧生成的深度图D_t齐次坐标下的每个像素p_t [u,v,1]ᵀ 被反投影至3D相机空间具体如下P_t D_t(u, v) · K⁻¹p_t该过程将二维射影序列提升为度量三维点云 C_t {Pi_t}。度量场景流推导。为了捕捉潜在的四维4D动态特性利用协同生成的高密度光流 f_{opt} [Delta u, Delta v]T来建立时间上的对应关系。三维点 P_t 追踪至 t1 时刻的位置 P_t1其计算公式为P_t1 D_t1u Delta u, v Delta v) K-1(p_t Delta u, Delta v, 0]T)。随后3D 场景流定义为 f_{3D} P_{t1} - P_t表示每个点的度量位移。这种显式的 4D 映射确保生成的轨迹不仅仅是视觉上的伪影而是对应于物理上合理的 3D 运动。细化与可视化。为了抑制深度不连续处的伪影采用一种基于深度梯度的边缘滤波器将满足 ||∇D|| τ 条件的像素进行掩码处理。由此得到的细化 3D 轨迹被投影到标准的鸟瞰图BEV视角下。在定性分析中见图 1 中的“3D Flow”面板这些轨迹被渲染为彩色踪迹并叠加在按深度排序的点云背景之上从而直观地验证了模型在时空上的一致性。3 RynnWorld-4D为了实现 RGB-DF 序列的同步生成将一个预训练的视频生成模型扩展为三分支架构概览见图 4。这种表征不仅仅是通道的简单拼接它支持基于物理原理的反投影unprojection从而转化为 3D 场景流scene flow。将模态 m {rgb, depth, flow} 的潜在变量表示为 z_tm其中 t [0, 1] 代表流匹配flow-matching的时间步长。每个 z_tm都包含了包含 T 帧的完整时间序列信息。三分支架构。为了在保留预训练模型强大生成先验的同时捕捉各模态的独特特征将 Wan (Wang et al., 2025a) 的单分支骨干网络扩展为三分支结构。这种解耦设计允许每个模态建模其独特的特征分布——例如 RGB 的复杂纹理、深度的空间几何结构以及流flow的运动位移——从而减轻不同模态间的表征干扰。联合跨模态注意力机制。为了确保跨模态一致性引入联合跨模态注意力Joint Cross-Modal Attention, JA模块。该模块被插入到 Wan-2.2 模型的全部 30 层 Transformer 块中具体位置为第 0, 3, 6, …, 27 层总计包含 10 个 JA 模块。每个 JA 模块均置于其所在 Transformer 块的模态内自注意力intra-modal self-attention层之后。在进行跨模态融合之前每个分支 m {rgb, depth, flow} 都会接收一个可学习的模态嵌入 em初始化为零以确保模块初始状态为纯残差连接并经过针对该模态的 LayerNorm (LNm) 归一化处理从而对齐各分支间的数值尺度。每个分支 m 生成一个查询query和一个共享的键/值对KV pair该KV对可供所有其他分支的查询复用从而将每个区块的参数开销从 18d² 降低至 12d²。Token 的形状从 [B, T · S, d] 调整为 [B · T, S, d]从而将跨模态注意力限制在不同模态下同一时间帧的 Token 之间同时对 Qm_l 和 Km_l 施加 3D 旋转位置编码3D Rotary Positional Embeddings以便在各分支间一致地引入空间位置信息。每个 Query 仅关注两个互补模态的键Key 和 值Value。这里没有采用 ControlNet 中使用的双重零初始化这种方式被发现会导致鞍点死锁而是将零初始化的输出投影 OutProjm_l 与一个初始值为 1 的可学习门控 gm_l 结合起来。在初始化阶段令 OutProjm_l ≡ 0 可确保从第一阶段Stage-1的检查点平滑地进行热启动warm start同时tanh(gm_l) tanh(1) ≠ 0 保证非零梯度能够流入门控单元使其在训练过程中能够减小、增大或改变符号从而避免联合路径陷入原点。分阶段训练策略。为了弥合模态间显著的分布差异我们提出了一种分阶段训练范式阶段 1模态适配。在此初始阶段我们禁用“联合跨模态注意力”Joint Cross-Modal Attention机制并独立训练三个分支。这使得深度depth和光流flow分支能够有效适应各自的几何和运动分布。阶段 2联合注意力训练。我们在总共 30 个 Transformer 块中每隔三层插入一个联合跨模态注意力模块。此时整个骨干网络backbone以及各分支内部的自注意力self-attention和前馈网络FFN均保持冻结状态仅联合跨模态注意力模块中的投影层、RMSNorm、各模态专属的 LayerNorm、tanh 门控机制以及三个模态的嵌入embeddings是可训练的。联合跨模态注意力机制采用 3D RoPE旋转位置编码和逐帧掩码frame-wise mask以确保跨模态注意力仅在同一时间帧内进行交互。阶段 3全参数联合监督微调SFT。在联合模块已完成对齐的基础上我们解冻整个模型并在完整的 Rynn4DDataset 1.0 数据集上继续训练。分支丢弃Branch Dropout。在阶段 2 和阶段 3 中我们在每个训练步骤以概率pdropp_{drop}pdrop随机选择 {depth, flow} 中的一个分支并将其带有噪声的潜在表示即第 1 帧及之后的帧替换为纯高斯噪声这迫使联合注意力JA模块必须利用可见模态的信息来重建该分支的数据。RGB 分支从不被丢弃因为它充当了外观基准appearance anchor若将其破坏联合模块将失去一致的参考依据。训练目标。所有三个阶段均采用流匹配flow matching目标函数Lipman2022进行优化。对于每个模态 m {rgb, depth, flow}学习一个速度场 vm_theta该速度场将高斯噪声 epsilonm沿路径 zm_t (1 - t)zm_0 t epsilonm输运至数据 zm_0。每个模态的第一帧作为“图像转视频”任务的干净条件潜表示分别为真实的 RGB 帧、真实的深度帧和零流帧不参与监督计算用切片 [1:] 来表示第 1 到 T-1 帧。4 RynnWorld-4D-Policy利用 RynnWorld-4D 作为预测性 4D 视觉编码器。给定当前的 RGB-D 观测和指令将输入数据通过冻结参数的 RynnWorld-4D 进行前向传播从而获得一个编码未来动态的潜轨迹表征——这为机器人操作任务提供强有力的特征表示。提取各分支的中间隐藏状态并沿通道维度进行拼接以构成 F_p其中 C 为每个分支的潜通道维度。通过拼接来自这些解耦分支的特征RynnWorld-4D-Policy 受益于各分支的专用表征RGB 分支提供丰富的视觉上下文而独立的深度depth和光流flow分支则分别提供明确的几何与运动线索。Flow Former。为了压缩 4D 特征采用一个带有可学习查询向量 Q 的 Flow Former 模块。该模块对 F_p 进行处理具体流程为先执行逐帧的空间交叉注意spatial cross-attention计算随后进行时间自注意temporal self-attention计算。动作生成。采用流匹配Flow MatchingLipman2022策略来生成动作。在此过程中速度场 v_phi 作用于动作空间 a并以预测的 4D token Q’、文本嵌入 l_emb 和本体感知 p_0 为条件。在推理阶段通过 ODE 求解器在 N4 个步骤内推导出动作从而利用并行动作分块action chunking技术实现高频闭环控制。5 推理延迟与实时控制为了评估 RynnWorld-4D-Policy 在现实场景中的可行性对推理流水线进行详细的时间分析。该模型部署在配备 NVIDIA RTX 5090 GPU 的工作站上利用 FP8 量化和 FlashAttention 3 (FA3) 算子来加速基于 Transformer 的 4D 生成过程。值得注意的是4D 视觉特征是在单次前向传播N 1中从冻结的 RynnWorld-4D 模型提取的。随后的动作生成所需的 4 步 ODE 采样仅在轻量级的 RynnWorld-4D-policy 头部head内进行。延迟细分。整体控制频率取决于 RynnWorld-4D 前向传播与动作生成头部的总循环时间。在单次前向传播生成 K 10 个动作序列的情况下循环时间约为 1.1 秒从而实现约 9 Hz 的控制频率。表 1 详细列出了各阶段的耗时情况。主要瓶颈在于三分支 Transformer 结构其耗时占总延迟的 89.5%。控制频率。区分规划频率4D 世界模型更新其内部状态的速率与有效控制频率至关重要。尽管单次前向传播耗时约 1.1 秒对应规划频率约为 0.9 Hz但 RynnWorld-4D-Policy 采用动作分块action chunking策略即在单次推理中预测 K 10 个未来步骤的动作。由于这 10 个动作按顺序执行同时并行计算下一个规划周期系统实现了约 9 Hz 的有效控制频率。闭环鲁棒性。虽然 9 Hz 的频率低于传统的底层 PID 控制器通常超过 500 Hz但 RynnWorld-4D-Policy 通过以下两种机制保持了高鲁棒性策略输出的不是单个动作而是包含 K 10 个未来动作的序列。在约 1.1 秒的推理周期内机器人通过缓存查找以 50 Hz 的频率执行预先规划好的动作块。 9 Hz 的更新频率足以捕捉大多数人类尺度的操作动态。与容易受视觉混叠或深度歧义影响的二维2D策略不同策略的内部潜表征latents是基于三维3D场景流构建的。消融实验表明引入显式的运动线索使策略能够预测物体的运动。这种预测能力弥补从感知到执行的微小延迟因为模型不仅是对当前帧做出反应而是基于预测的四维4D轨迹进行决策。在实际测试中即使物体在 1 秒的执行窗口内受到轻微碰撞下一次 9 Hz 的更新也能有效地重新规划轨迹这是因为 RynnWorld-4D 的潜表征涵盖空间体spatial volume而非仅仅是像素点从而提供更宽广的恢复捕捉范围。1 实现细节RynnWorld-4DRynnWorld-4D 模型基于 Wan 2.2-TI2V-5B 扩散 Transformer (Wang et al., 2025a) 构建该模型是一个 30 层的 DiT其隐层维度 d 3072FFN 维度为 14,336。将原有的单分支 RGB 主干网络扩展为统一的三分支架构以同步生成 RGB、深度和光流序列。深度和光流分支通过复制预训练主干网络中的组件包括 Patch Embedding、自注意力机制、归一化层和 FFN进行初始化从而利用视频主干网络强大的时空先验知识。为了在确保语义对齐的同时最小化计算开销在三个分支间共享文本交叉注意力机制的 Key/Value 投影因为语言任务描述提供一种模态无关的语义信号。在全部 30 层 Transformer 块中每隔三层即第 0、3、6、……、27 层插入一个联合跨模态注意力Joint Cross-Modal Attention, JA模块总计 10 个模块。对于每个分支 mJA 模块会查询来自互补模态即 j ≠ m的拼接 K/V 对。为了确保从独立分支训练平稳过渡将输出投影层初始化为零同时保持 gm_l 1。JA 采用 3D RoPE 和逐帧掩码frame-wise mask将注意力限制在同一时间帧内的 Token 上。分阶段训练策略。采用三阶段的课程学习curriculum learning策略来弥合模态分布差异。表 2 总结了各阶段的配置。为了确保稳定性每个阶段均基于上一阶段仅包含模型参数的检查点checkpoint进行初始化同时重置优化器和调度器状态。用 AdamW 优化器beta_10.9, beta_20.95$权重衰减 1 X 10-4并配合余弦退火调度与线性预热warm-up。此外在 CPU 上维护一份影子权重shadow weights的指数移动平均EMA衰减系数 0.9999用于推理阶段。阶段 1模态适配Modality Adaptation。各分支在特定模态的流匹配flow-matching监督下独立训练旨在将 RGB 先验知识重新用于几何与运动建模同时避免梯度干扰。训练采用 2×10⁻⁵ 的学习率、500 步预热warm-up以及 0.5 的流权重λflow。阶段 2冻结主干网络的联合注意力Frozen-Backbone Joint Attention。冻结主干网络并实例化 10 个联合注意力JA模块。为保留已建立的表征JA 模块的输出投影层采用零初始化。学习率设为 5×10⁻⁵预热步数为 200。针对 {深度, 光流} 分支应用分支丢弃Branch Dropoutpdrop0.2以增强跨模态鲁棒性。阶段 3全参数联合 SFT。解冻整个模型在 Rynn4DDataset 1.0 上进行联合微调。所有可训练参数的学习率设为 1×10⁻⁵分支丢弃率降至 pdrop0.1。资源与优化。所有阶段均在 81 × 480 × 640 的输入规模下进行训练在因果 VAE 的 4 倍时间压缩下产生 T 21 帧潜在帧即 T_latent (T_pixel − 1)/4 1并采用 bf16 混合精度与梯度检查点gradient checkpointing技术。阶段 2 和阶段 3 利用 DeepSpeed ZeRO-2 及其优化器卸载optimizer offload功能以管理新增 JA 参数带来的显存需求。RynnWorld-4D-Policy用 RynnWorld-4D 作为冻结的 4D 视觉编码器。该模型在 480×640 分辨率下运行生成 T 21 帧潜在帧经 VAE 4 倍时间压缩后。在每次推理步骤中在扩散时间步 t 500 处执行单步特征提取获取 Transformer 第 15 层模块的中间隐状态。通过拼接来自 RGB、深度和光流分支的 3072 维特征获得一个综合的 4D 表征 F_p。在每个决策步骤中以单帧 RGB 观测图像作为输入。条件帧经中心裁剪至 480 × 640 尺寸并归一化至 [−1, 1] 范围。提取的时空特征经重塑后输入 Flow Former 模块该模块将高维 RynnWorld-4D 特征压缩为适合策略解码的固定大小表征。采用流匹配flow matching策略头并在推理阶段使用 4 步欧拉 ODE 采样。尽管动作空间涉及多步采样但该策略仍保持了高效率因为计算量巨大的 4D 主干网络特征仅需计算一次。该策略预测长度为 10 的动作序列action chunks其中每个动作均为 54 维。在部署阶段模型以开环方式执行 10 个动作后才重新查询视觉主干网络从而实现约 9 Hz 的有效控制频率。训练采用 AdamW 优化器学习率为 1 × 10⁻⁴β (0.9, 0.9)权重衰减系数为 0.05。用三阶段学习率调度策略2% 的线性预热warmup、8% 的恒定保持以及 90% 的余弦衰减衰减至峰值学习率的 10⁻⁶ 倍。RynnWorld-4D 主干网络在整个训练过程中保持冻结状态仅优化 Flow Former 和流匹配策略头。训练采用混合精度模式单 GPU 批次大小batch size设为 1共训练 100 个 epoch。2 设置与基线方法世界模型指标。为了评估世界模型的生成性能与物理保真度在一个包含 50 个视频序列的独立测试集上进行了基准测试这些序列是从 (Wu et al., 2024; Liu et al., 2024; Jiang et al., 2025b) 中随机抽取的。从以下三个维度对模型进行评估(1) 视觉合成质量生成保真度参考 (Zhou et al., 2025) 的指标IQ、MS、SC、Subj.以及与真值ground truth的像素级对齐度PSNR、SSIM、LPIPS(2) 几何精度通过深度估计指标AbsRel、δ1 1.25评估结构完整性(3) 时间运动一致性通过光流误差AEPE衡量动态精度。真实世界任务指标。主要评估指标为成功率Success Rate定义为在连续 35 次真实世界试验中成功完成任务的比例。若机器人能在 120 秒内完成任务则视为试验成功。硬件平台。为了进行真实世界数据采集和策略评估使用配备 WUJI HAND无极手的 TIANJI M6 机器人并集成了 RealSense D435i 相机以获取第一人称视角FPV图像。机器人任务。为了展示其流程在各种操作挑战中的泛化能力本文在六项不同任务上评估了该方法这些任务涵盖了不同程度的双臂协作、接触丰富度及精度要求(1) 双重抓取Dual Picking机器人利用左臂从盘中抓取一个苹果同时利用右臂抓取一根香蕉并依次将这两个物体放置在桌面上。(2) 方块推动Block Pushing一项连续推动任务左臂先将一个大方块从左侧区域推至中心位置随后右臂接手将其推至指定的右侧目标区域。(3) 移交机器人内部传送任务左夹具拿起一棵卷心菜并将其交给右夹具然后右夹具完成放置。(4) 双手举起双臂必须同步从桌子上举起西瓜毛绒并准确地将其放入托盘中的重载协调任务。(5) 盖子放置一项精确任务要求机器人拾起盖子并准确对齐以盖住纸板箱。(6) 碗堆放桌上有两个小碗这项任务包括拿起一个碗并小心地将其叠在另一个碗上。如图 5 所示这些任务共同挑战了模型在双臂协同、时间排序和长视野交互方面的熟练程度。标签。图 3 总结了每个任务的演示预算完整的语料库用于训练 RynnWorld-4D使其接触丰富多样的物理交互而每个任务 200 集的固定预算分配用于训练 RynnWorld-4D-Policy。对于每项任务通过对初始环境状态应用显着随机化来评估模型的泛化能力。这包括根据工作空间坐标和轴向旋转来改变任务相关对象例如水果的 6-DoF 姿态。3 真实机器人系统搭建真实机器人系统基于 TIANJI M6 机械臂和 WUJI 灵巧手构建如图 7 所示。策略的推理频率设定为 50 Hz指令发送延迟保持在 18 到 30 毫秒之间。底层接口以 500 Hz 的频率运行以确保平滑的实时控制。控制策略与底层接口之间的通信通过 LCMLightweight Communications and Marshalling实现。通过遥操作系统采集真实世界的演示数据硬件配置包括一对 Tianji 7 自由度机械臂和一对 Wuji 20 自由度灵巧手总计拥有 54 个自由度。在机械臂控制方面操作员佩戴五个 HTC Vive 追踪器分别安装在胸部、双腕和双上臂。系统以 100–120 Hz 的频率计算手腕相对于胸部的变换关系并将其输入到一个在独立进程中运行的、基于 Pinocchio 库的逆运动学求解器中。求解出的关节指令经由 Ruckig 轨迹生成器进行平滑处理考虑速度、加速度和加加速度约束随后以 200 Hz 的频率发送给机械臂。在灵巧手控制方面操作员佩戴 Manus 数据手套。手套的原始信号被转换为 21 点 MediaPipe 手部骨架格式并通过专用重定向模块映射到 Wuji 灵巧手的 20 自由度关节空间同时应用指数移动平均滤波器以实现运动平滑。