具身智能之Vlaser详解:推理分数高,不等于机器人更会动——VLM→VLA 迁移实验

📅 2026/7/22 0:16:42
具身智能之Vlaser详解:推理分数高,不等于机器人更会动——VLM→VLA 迁移实验
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读给机器人加入视觉语言模型直觉上像是把“理解场景、规划任务、执行动作”接成一条自然链路。但这里藏着一个经常被跳过的问题一个模型在具身问答、空间关系和视觉指代基准上更聪明是否就一定能让机械臂完成更多闭环任务Vlaser的价值首先在于把这个问题做成了一组受控实验。作者从同一个 InternVL3 主干出发分别加入通用具身推理数据以及来自 Google Robot、WidowX、Aloha-AgileX 机器人观测域的问答、定位与空间数据再用相同的动作数据微调 VLA。结果很直接通用推理数据能显著抬高 12 个上游基准的平均分却只给下游控制带来很小的收益与机器人视角同域的数据才明显改善 VLA 的训练收敛和任务成功率。在方法上Vlaser 用 InternVL3 处理图像与语言再接入共享自注意力的 action expert通过 flow matching 生成连续动作块。配套的Vlaser-6M覆盖 grounding、具身问答、空间智能、规划以及约 200 万条同域多模态问答数据。2B 版本在 12 项具身推理基准上的平均分由 15.2 提升到 45.3加入全部同域数据后WidowX SimplerEnv 平均成功率由 41.8% 提升到 65.1%RoboTwin 12 个任务的平均成功率由 55.8% 提升到 67.5%。猫先生认为这篇论文最重要的结论并不是“再造一个更强 VLA”而是给 VLM 到 VLA 的迁移加了一条边界条件能力标签相同不等于输入分布相同。机器人真正缺少的可能不只是抽象推理能力而是能在自身相机视角下稳定调用这些能力的数据接口。论文标题Vlaser: Vision-Language-Action Model with Synergistic Embodied ReasoningOpenReviewhttps://openreview.net/forum?id8xTDnj39TiarXivhttps://arxiv.org/abs/2510.11027GitHubhttps://github.com/OpenGVLab/Vlaser模型与数据https://huggingface.co/collections/OpenGVLab/vlaser图 1原论文 Figure 1。左上是 Vlaser-6M 的数据构成右上汇总具身推理基准左下展示训练收敛右下给出 Google Robot 与 WidowX 的仿真执行片段。原文脉络论文第 1 节提出核心问题上游具身推理能力能否迁移到下游 VLA 控制。第 2 节介绍 Vlaser 架构、Vlaser-6M 数据引擎和两阶段训练方案。第 3 节先评估 12 项具身推理基准再进入 SimplerEnv 与 RoboTwin 的闭环控制实验最后通过数据消融和推理配置分析收益来源。相关工作被放在第 4 节第 5—6 节集中讨论仿真评测等限制并总结“同域推理数据”对 VLA 的意义。1、4. 问题背景会回答不代表会控制VLA 通常沿两条路线发展。一条从机器人策略出发把视觉、语言和动作放进同一个序列模型另一条从 VLM 出发希望利用大规模图文预训练中的常识、空间关系与任务规划能力。后者很有吸引力因为 Web 数据远多于机器人轨迹但 VLM 的能力通常在静态图片、第三人称画面和问答任务上被验证而机械臂控制面对的是腕部或固定机位视频、连续状态变化和容错率很低的动作输出。因此“具身推理”至少包含两个层面一是能否说对物体位置、空间关系和操作步骤二是这些判断能否在当前机器人的观测分布中为低层动作提供稳定表征。已有基准主要测第一层Vlaser 试图测清两层之间到底隔着多远。论文把训练数据区分为OOD 推理数据和同域推理数据。这里的 OOD 不是说内容与机器人完全无关而是图像分布来自互联网、通用数据集或不同场景同域数据则直接从下游仿真环境和对应机器人视角中生成。这个划分贯穿后面的全部实验也是理解结果的钥匙。2. 方法让视觉语言主干与动作专家协同训练2.1 模型结构VLM 负责理解action expert 负责连续动作Vlaser 的视觉语言主干采用 InternVL3分别构建 2B 和 8B 版本InternViT 将图像编码为视觉 tokenQwen2.5-1.5B 或 Qwen2.5-7B 负责语言建模。VLA 微调时作者在主干旁加入机器人专用的 action expert形成类似双专家混合模型的结构。机器人状态被编码为 state token加入噪声的连续动作被编码为 action token。视觉语言分支与动作分支保留各自的参数但在自注意力层共享信息动作序列使用非因果注意力使一个 action chunk 内的多个时间步能够联合建模。最终action expert 根据图像、指令和本体状态预测去噪方向通过 flow matching 逐步还原连续动作。图 2原论文 Figure 2。左侧是 Vlaser-6M 上的多模态预训练右侧是在视觉语言主干旁加入 action expert 的 VLA 微调两条分支通过共享自注意力交换信息。这种分工避免了把机械臂关节量强行当作普通文字 token同时又让动作专家直接读取预训练主干中的视觉语义。默认设置一次预测 4 步动作执行 4 步后重新观察推理阶段用 10 次欧拉积分完成 flow matching 采样。2.2 Vlaser-6M通用能力与机器人视角分开构造Vlaser-6M 并不是单一来源的数据集而是围绕四种可迁移能力组织的数据混合Grounding约 150 万条高质量定位问答另加入约 30 万条由 SA-1B 构造的点和框标注坐标统一归一化到 0—1000具身问答约 120 万条机器人场景问答覆盖状态理解、可操作性和下一步行为空间智能约 50 万条距离、方位、计数与三维关系样本其中约 10 万条来自人工标注的三维场景数据规划约 40 万条从目标到操作步骤的层级规划样本。此外作者从 SimplerEnv 和 RoboTwin 中抽取 Google Robot、WidowX、Aloha-AgileX 的画面构造约200 万条同域多模态问答。它们同样覆盖一般问答、规划、定位与空间关系但画面来自之后要训练和评测的机器人观测域。这个设计让实验可以比较三件事只增强通用推理是否有用只加入某一类同域能力哪类更有效把同域 QA、空间和 grounding 合并能否互补。2.3 两阶段训练先学会看和说再学习怎么动第一阶段在 Vlaser-6M 上做多模态监督微调视觉语言模型以自回归语言损失学习回答、定位和规划。第二阶段加入 action expert用机器人 demonstration 进行 VLA 微调动作端采用 flow matching 损失。作者并没有要求模型在每次控制前输出长篇推理链。这里的“synergistic embodied reasoning”主要体现在预训练表征为动作学习提供条件而不是把可见思维过程直接插入控制循环。这样控制开销较低也使研究问题更干净若动作成功率变化主要变量就是上游数据与表征而不是额外的测试时推理流程。猫先生认为这种两阶段方案的优点是便于归因但“同域推理数据有效”仍不能完全等价为“推理能力迁移成功”。同域问答同时改变了视觉分布、对象覆盖和语言描述收益可能很大一部分来自视觉域对齐。论文证明了数据接口有效却还没有把语义推理与观测适配的贡献彻底拆开。3. 实验上游高分与下游成功率并不同步3.1 12 项具身推理基准小模型追上通用大模型评测覆盖 PointArena、Where2Place、Ego-Plan2、ERQA、EmbodiedBench、VLABench、MMSI-Bench、RefSpatial-Bench、VSI-Bench、PixMo-Points 和 Paco-LaVIS 等 12 项测试涉及点定位、空间关系、规划与具身问答其中 EmbodiedBench 分别在 ALFRED 和 Habitat 环境中计分。模型参数规模12 项平均分InternVL3-2B2B15.2Vlaser-2B2B45.3InternVL3-8B8B22.3Vlaser-8B8B51.3Gemini-2.5-Pro未公开44.4Vlaser-2B 的平均分已经超过表中 Gemini-2.5-Pro8B 版本进一步达到 51.3。规模更大并非处处占优2B 在部分简单点定位任务上反而更好8B 的优势更多出现在规划和复杂场景理解。这说明数据配方带来的任务适配至少在这些基准上比单纯扩大主干更关键。3.2 WidowXOOD 推理只涨 1.4 个点同域数据涨 23.3 个点WidowX SimplerEnv 包含把胡萝卜放到盘子、把茄子放入篮子、把勺子放到毛巾上和堆叠方块四项任务。视觉语言初始化四任务平均成功率InternVL3-2B41.8%Vlaser-OOD43.2%Vlaser-QA62.6%Vlaser-Spatial60.8%Vlaser-Grounding62.0%Vlaser-All65.1%仅使用通用具身推理数据的 Vlaser-OOD相比原始 InternVL3 只提高 1.4 个百分点同域 QA、空间和定位数据分别带来约 19—21 个百分点提升三类合并后的 Vlaser-All 达到 65.1%。论文还展示了更快的训练收敛说明收益不只是最后几个检查点的偶然波动。图 3原论文 Figure 6。原始 InternVL3-2B 在四个示例中失败而使用同域数据的 Vlaser 与 Vlaser-QA 能完成目标。定性案例用于观察行为差异成功率结论仍应以批量评测为准。3.3 Google Robot 与 RoboTwin同域组合整体最稳但并非全面领先初始化方式Google RobotVisual MatchingGoogle RobotVariant AggregationRoboTwin 12 任务平均InternVL3-2B64.0%54.7%55.8%Vlaser-OOD68.7%51.3%54.5%Vlaser-All76.2%59.0%67.5%结果再次出现同样的分化OOD 数据在 Google Robot 的视觉匹配设置中有帮助却在 Variant Aggregation 和 RoboTwin 上略低于基线Vlaser-All 则在三个汇总指标上都优于相同主干。RoboTwin 中Vlaser-All 也高于 RDT-1B 的 36.8%。但 Vlaser 不是所有对比中的第一名。Google Robot 上Magma 分别达到 68.4% 和 62.6%在 Variant Aggregation 上高于 Vlaser-All。更稳妥的结论是Vlaser 验证了同域多模态预训练对多个机器人平台具有一致价值而不是已经解决所有 VLA 泛化问题。3.4 消融改变动作块与采样步数结论仍保持作者继续改变预测长度、实际执行长度和 flow matching 采样步数。在多组配置中Vlaser-OOD 相对 InternVL3 的增益都有限同域 QA 初始化则持续领先。默认的“预测 4 步、执行 4 步、采样 10 次”不是唯一有效设置因此主要收益不太可能只是控制超参数恰好匹配。这组消融支持论文的中心判断常见具身推理基准的上游分数与特定机器人上的低层闭环成功率没有稳定正相关。模型既要知道“该做什么”也要在机器人自己的画面里认出“现在在哪里、目标是什么、怎样接近”。5—6. 局限与结论关键证据成立但“推理迁移”仍需继续拆解最直接的限制是没有真实机器人实验。SimplerEnv 与 RoboTwin 能提供可重复的大规模闭环评测也比离线动作误差更接近真实控制但仿真中的视觉、接触和动力学仍无法覆盖真实硬件的相机噪声、标定偏差、抓取滑移与安全约束。因此论文能够证明同域数据在仿真域内有效尚不能证明同样的增益会原样迁移到实机。第二实验把同域问答称为具身推理数据但没有设置“同样图像、只做视觉自监督或图文描述”的严格对照。因而无法准确判断增益来自空间推理、任务语义还是更基础的相机视角和对象外观对齐。后续研究需要控制图像来源与标注形式拆分域对齐、语义监督和推理监督三项贡献。第三上游评测虽多达 12 项但下游只覆盖有限机器人平台和操作基准不同模型的动作数据、训练预算也会影响横向比较。Vlaser 已公开代码、模型与数据集合便于复查核心结论不过完整复现实验仍需要较大的多模态预训练和仿真评测成本。Vlaser 最值得带走的不是某个单项分数而是一条数据设计原则要把 VLM 的知识交给 VLA不能只问“数据是否包含机器人推理”还要问“这些推理是否发生在机器人真正看到的世界里”。通用数据负责扩展知识边界同域数据负责建立可调用的视觉接口两者协同才可能让“会说”稳定地变成“会做”。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列