《VLA 系列》Human-to-Robot Transfer | 人类视频共训练 | 跨本体涌现迁移 | 论文解析

📅 2026/8/16 4:00:05
《VLA 系列》Human-to-Robot Transfer | 人类视频共训练 | 跨本体涌现迁移 | 论文解析
人类视频数量大、场景丰富采集成本也比机器人遥操作低得多但人和机器人长得不一样、运动方式不一样动作空间更不一样。过去的方法通常要做视觉域对齐、手部重定向或专门的跨本体模块。这篇论文给出的结论反而很简单当 VLA 已经在足够多的场景、任务和机器人本体上预训练后不需要额外设计显式对齐损失仅通过人类数据与机器人数据共微调人类示范中的新场景、新物体和新任务知识就能迁移到机器人。先说结论方法以 π0.5 为基座把人类视为训练混合中的一种新本体而不是额外接一个 human-to-robot 转换网络。人类视频并非裸视频作者使用头戴相机和双腕相机恢复头部 6D 轨迹、双手 3D 关键点并密集标注子任务文本。训练同时使用高层子任务预测和低层动作预测低层动作既监督离散 FAST token也监督连续 Flow Matching 动作头。迁移并不会在小模型或低多样性预训练阶段自然发生。预训练覆盖达到 75%、100% 以及更多机器人本体后人类数据带来的增益才明显出现。四项泛化任务中Spice 从 32% 提升到 71%Dresser 从 25% 提升到 50%鸡蛋颜色分类准确率从 57% 提升到 78%。论文https://arxiv.org/abs/2512.22414官方项目页https://www.pi.website/research/human_to_robotπ0.5 基座代码https://github.com/Physical-Intelligence/openpi需要提前说明论文没有给出这套人类数据处理、共训练配方和 benchmark 的官方源码。1、论文真正解决的是数据能否被模型吃进去把人类视频用于机器人学习难点通常被概括为 domain gap人手和机械臂外观不同人的头部运动和移动底盘不同人也没有与机器人夹爪完全对应的控制量。小规模方法往往要人为缩小这个差异例如遮挡手部、生成机器人外观、做动作重定向或只提取关键点、可供性和奖励等中间信号。这篇工作的出发点不同。作者把问题改写成当 VLA 已经通过大规模、多任务、多场景、多本体预训练学到足够通用的表示后它能否像大语言模型利用异构指令数据一样自行利用人类示范图 1 的重点不是两条曲线都随着预训练增强而上升而是两条曲线之间的距离。蓝线是不加入人类数据的机器人微调黄线是人类与机器人共微调。预训练较弱时两者几乎没有差别预训练多样性跨过一定范围后黄线才明显高于蓝线。换句话说预训练规模不仅提高了基础成功率还改变了模型利用新数据源的能力。2、π0.5 ego 如何统一人类和机器人数据2.1 几个容易混淆的概念概念论文中的含义是否在机器人推理时使用π0.5预训练 VLA 基座包含视觉语言骨干与动作专家是π0.5 egoπ0.5 在人类第一视角数据和相关机器人数据上共微调后的模型是人类 embodied data带头部/手部运动信号和子任务标注的第一视角视频不是普通无标注网络视频仅训练使用高层子任务对当前阶段的短文本描述如拿起香料瓶”先由模型预测再作为低层动作条件低层动作一段未来末端位姿、底盘运动及机器人夹爪控制是embodiment-agnostic representation对同一任务的人类观测和机器人观测形成更接近的隐表示是论文分析结果不是额外模块作者做的主要工作是把人类数据加工到与机器人数据大致相容的观测、语言和动作表示中再使用同一套训练目标。图 3 把训练和测试的边界画得很清楚。每项实验都选择一个机器人数据没有覆盖、但人类数据覆盖的新概念新房间、新物体或新的任务语义。微调数据中人类目标任务与最相近的机器人任务按 50:50 混合最终只在仅出现在人类示范中的目标条件上测试机器人。2.2 人类数据如何采集和加工作者让采集者佩戴一个头部相机和两个腕部相机按机器人遥操作数据的 episodic 形式重复完成任务。四项任务的人类数据分别为Bussing 3 小时、Spice 3 小时、Dresser 3 小时、Sort Eggs 5 小时合计 14 小时。原始视频要经过三步加工使用视觉 SLAM 恢复头戴相机相对固定世界坐标系的 6D 位姿e t ∈ R 6 e_t\in\mathbb{R}^{6}et​∈R6。在头部相机坐标系中恢复双手各 17 个 3D 关键点h t e ∈ R 3 × 17 h_t^e\in\mathbb{R}^{3\times17}hte​∈R3×17。对每段示范进行密集子任务标注分别描述两只手正在完成的短时原子动作。这里有一个很重要的工程前提论文虽然强调不做显式迁移学习但并不是完全不做对齐。它仍然通过相机配置、3D 跟踪、相对位姿和任务标注完成了数据接口层的弱对齐被省掉的是专门的域适配网络、额外对齐损失和人工机器人化视觉转换。2.3 动作空间如何对齐机器人动作不使用关节角而使用更容易和人手对应的末端位姿。对长度为H HH的动作块a t : t H [ a t , a t 1 , … , a t H ] a_{t:tH}[a_t,a_{t1},\ldots,a_{tH}]at:tH​[at​,at1​,…,atH​]其中H HH是动作块长度a i a_iai​表示相对于当前状态s 0 s_0s0​的未来 6DoF 位姿或其他控制量。使用相对运动而不是绝对世界坐标可以减小不同房间、不同初始位置和不同本体之间的坐标差异。机器人侧每个时间步包含左臂 6DoF 夹爪、右臂 6DoF 夹爪、2 维底盘动作共 16 维因此动作块为a ∈ R H × 16 a\in\mathbb{R}^{H\times16}a∈RH×16。人类侧则用手掌、中指和无名指的 3D 关键点定义一个近似末端位姿。两只手各提供 6DoF头部相机轨迹提供 6DoF一共 18 维。作者没有估计人的夹爪开合机器人夹爪能力完全从机器人数据中学习。2.4 模型结构高层语言和低层动作一起迁移模型先根据图像和高层任务指令预测短时子任务再把这个子任务作为低层动作生成条件。对于整理梳妆台高层输出可能是把项链放进首饰盒低层动作专家再生成双臂和底盘的连续动作块。这种分层设计让人类数据可以从两个层面提供监督高层迁移学到哪些物体应该放到哪里、任务下一步是什么。低层迁移学到接近物体、搬运和放置时的相对运动模式。它仍然是 VLA不是 World Model 或 World-Action Model。模型没有预测未来图像也没有用未来视觉子目标驱动动作未来预测仅指动作块预测。3、训练流和推理流3.1 训练流VLA 的基本监督样本写成D ( o t , l t , a t : t H ) \mathcal{D}\left(o_t,l_t,a_{t:tH}\right)D(ot​,lt​,at:tH​)其中o t o_tot​是当前多视角视觉观测和可用状态l t l_tlt​是任务语言a t : t H a_{t:tH}at:tH​是未来动作块。策略学习的是π θ ( a t : t H ∣ o t , l t ) \pi_\theta(a_{t:tH}\mid o_t,l_t)πθ​(at:tH​∣ot​,lt​)θ \thetaθ表示模型参数。这个式子的直观含义是看到当前环境并理解任务后一次预测接下来一段动作而不是只预测单步控制。论文的共微调流程可以概括为从人类视频提取头部 6D 轨迹、双手 3D 关键点和相对动作并添加子任务文本。从机器人数据选择语义上最近的任务例如用把鸡蛋放进纸盒对应人类的按颜色分拣鸡蛋。按 50:50 采样人类目标任务与最近邻机器人任务。对高层子任务做自回归 next-token predictionp θ ( l t subtask ∣ o t , l t ) p_\theta(l_t^{\text{subtask}}\mid o_t,l_t)pθ​(ltsubtask​∣ot​,lt​)l t subtask l_t^{\text{subtask}}ltsubtask​是当前短时子任务文本。它既是训练标签也会在推理时成为低层策略的条件。对低层动作同时训练离散 FAST token 预测和连续 Flow Matching 动作预测π θ ( a t : t H ∣ o t , l t subtask ) \pi_\theta(a_{t:tH}\mid o_t,l_t^{\text{subtask}})πθ​(at:tH​∣ot​,ltsubtask​)Flow Matching 中训练代码将真实动作a aa与高斯噪声ϵ \epsilonϵ混合x τ τ ϵ ( 1 − τ ) a x_\tau\tau\epsilon(1-\tau)axτ​τϵ(1−τ)au τ ϵ − a u_\tau\epsilon-auτ​ϵ−aL FM E [ ∥ v θ ( x τ , o , l , τ ) − u τ ∥ 2 2 ] \mathcal{L}_{\text{FM}}\mathbb{E}\left[\left\|v_\theta(x_\tau,o,l,\tau)-u_\tau\right\|_2^2\right]LFM​E[∥vθ​(xτ​,o,l,τ)−uτ​∥22​]这里τ ∈ ( 0 , 1 ) \tau\in(0,1)τ∈(0,1)是生成模型内部的噪声时间不是机器人真实物理时间x τ x_\tauxτ​是被加噪的动作块u τ u_\tauuτ​是目标速度场v θ v_\thetavθ​是动作专家预测的速度。训练目标是让模型学会把纯噪声沿速度场逐步推回到可执行动作分布。3.2 推理流机器人测试时不需要人类视频、未来图像、人体 3D 关键点或 SLAM 轨迹。推理链路是输入机器人当前的多相机观测和用户任务指令。高层策略预测当前子任务文本。子任务文本与当前观测一起条件化低层动作专家。动作专家从高斯噪声出发经过多步 Flow Matching 积分得到连续动作块。机器人执行动作块获取新观测后继续闭环预测。openpi当前 JAX 实现中sample_actions(..., num_steps10)默认使用 10 个积分步并明确采用τ 1 \tau1τ1为噪声、τ 0 \tau0τ0为目标动作的约定。这个噪声时间不要与动作块跨度或控制频率混为一谈。论文没有报告本文实验的端到端推理延迟和实际控制频率不能从默认代码配置反推真机设置。4、迁移为什么会随预训练多样性出现作者构造了六档初始化0% 仅有 VLM 初始化25%、50%、75%、100% 逐步增加目标 ARX 和 mobile ARX 的“场景-任务”组合100% X-emb 再加入大量非目标机器人本体也就是完整 π0.5 预训练混合。图 2 画的不是最终成功率而是“人类 机器人微调”相对“仅机器人微调”的绝对分数增益。0% 和 25% 时几乎没有稳定收益75%、100% 后增益快速增加加入跨本体预训练后总体迁移更强。这说明更强的零样本泛化和更强的人类数据利用能力相关但不是同一个量。附录中的逐任务曲线更能说明问题某些检查点升级并没有提高机器人-only 的目标任务表现却明显提高了加入人类数据后的表现。也就是说预训练多样性可能先改善可迁移性不一定立刻表现为目标任务的零样本成功率。作者进一步对 VLM 最后一层输出的前 200 个 token 做均值池化再用 t-SNE 可视化。预训练较弱时人类和机器人样本分成两个簇随着场景、任务和本体多样性增加两者逐渐重叠。这个结果支持通用预训练产生本体无关表示的解释但它仍然是相关性证据。t-SNE 会扭曲全局距离论文也没有通过干预实验证明表示重叠就是迁移增益的唯一原因。因此更准确的表述是表示对齐与迁移能力同步增强为作者的机制假设提供了证据。5、实验结果到底证明了什么四个 benchmark 各自只让人类数据覆盖一个机器人数据缺失的概念任务泛化轴机器人数据已有能力人类数据新增概念指标Spice新场景在若干房屋整理香料架未见厨房全部香料瓶放入架子的二元成功率Dresser新场景在若干房屋整理梳妆台未见卧室项链和发夹正确归位的二元成功率Bussing新物体清理垃圾和餐具厨房工具等新物体9 个物体正确分类后的归一化得分Sort Eggs新任务抓取鸡蛋并放入纸盒按蛋壳颜色分到两个纸盒并关盒正确放置及关盒的归一化得分每个实验执行 20 到 40 次误差条为 1 个标准误。由于任务评分口径并不完全相同图中的柱高适合展示同一任务内部的增益不适合把 Bussing 的 0.6 与 Spice 的 0.6 当作完全同等难度。具体结果包括Spice 32%→71%Dresser 25%→50%Bussing 53%→63%。Sort Eggs 中仅机器人数据的策略会近似随机地把鸡蛋放入纸盒颜色分类准确率为 57%加入人类分拣示范后达到 78%平均多正确放置 4 个鸡蛋。论文还把人类数据与目标机器人数据、非目标机器人数据做了比较。Sort Eggs 和 Dresser 中相近规模的人类数据接近目标机器人数据的效果Bussing 中目标机器人数据仍明显更强报告的对比为 25% 对 65%。400 条、7.45 小时 UR5 示范迁移到 ARX 后也能超过基线但仍不如目标 ARX 数据。这更像跨本体机器人迁移而不是人类数据可以无条件替代目标机器人数据。5.1 高层和低层都要学在移动操作任务中只让人类数据训练高层或只训练低层都不如两层一起训练。只迁移高层时低层策略可能误解拿起香料瓶去抓托盘上已经放好的瓶子只迁移低层时高层策略又可能在瓶子拿起后仍反复输出同一个子任务。对于 Bussing 和 Sort Eggs评测时没有单独使用高层策略所以它们的增益证明低层动作预测本身也发生了迁移。5.2 腕部相机有帮助但不是所有任务都需要腕部视角在 Dresser 和 Bussing 上有明显收益在 Spice 和 Eggs 上差别较小。工程上比较合理的结论不是必须三相机而是近距离遮挡、精细放置和手部交互更强的任务更依赖腕部可观测性。若要规模化采集应根据任务是否需要近端视角评估传感器成本。6、方法价值、局限与工程判断这篇论文最有价值的地方不是又提出一种人手到机械臂的映射而是指出了一个数据工程方向当基座模型足够通用时人类动作数据可能像新的机器人本体数据一样被统一吸收。这让大规模人类数据的价值从训练视觉表征进一步走向直接改善动作生成。但从工程落地看还不能把结论理解为普通视频都可以直接拿来训练 VLA当前数据是专门采集的 episodic 示范手始终尽量处于视野内并带头部和腕部相机不是开放互联网视频。人类数据需要 SLAM、3D 手部跟踪和密集子任务标注数据处理成本仍然不低。论文只用了 14 小时目标人类数据尚未验证被动、无任务边界、长尾噪声视频的大规模预训练。四项任务集中在双臂/移动操作实验规模不足以给出普适临界点。人类 18 维动作与机器人 16 维动作如何进入统一实现、缺失夹爪标签如何 mask论文和代码都没有公开。人类数据在 Bussing 中仍明显弱于目标机器人数据说明接触细节、本体动力学和夹爪控制不能完全靠跨本体迁移补齐。t-SNE 只能支持表示对齐假设不能证明因果机制。