【HumanScale】重新定义预训练数据

📅 2026/7/23 4:28:41
【HumanScale】重新定义预训练数据
问题提出与实验设计预训练阶段更缺动作对齐还是世界覆盖北大HumanScale给出反直觉回答第一视角人类视频可能是更好的预训练数据源。作者固定模型架构、预训练时长、后训练数据只替换预训练数据源将HumanNet的5000h第一视角视频与同等规模机器人数据直接对比后训练用AgibotWorld的15个任务分Seen和Unseen评测。核心结果与数据差异Seen任务两类预训练差距不大loss 0.0067 vs 0.0071Unseen任务人类视频loss降至0.0204机器人数据为0.0254差距约20%。人类视频呈清晰scaling曲线100h→5000h持续下降R²达0.86/0.94机器人数据更早饱和。同样100h人类视频含45000条轨迹机器人仅8000条信息密度差异显著。作者判断与真实机器人验证作者划分预训练重coverage后训练重alignment。机器人数据局限源于固定工作台、有限物体等结构性约束。真实AgiBot实验人类视频预训练模型ID成功率92.5%OOD 90.0%无预训练基线ID仅40.0%OOD完全失效0.0%且预训练模型损失比基线低约2.4倍。边界与总结需注意真实实验对比的是“有无人类视频预训练”未与机器人数据预训练做同平台部署对比结论基于WAM架构迁移至VLA待验证。但HumanScale首次定量证明预训练阶段更广的数据覆盖比更强运动学对齐更重要。相关资料论文HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied PretrainingarXivhttps://arxiv.org/abs/2606.20521✍️文章转载于知乎梦落花原文链接https://zhuanlan.zhihu.com/p/2054905612228678573