RoboHarness:面向长时程规划异构机器人策略的记忆-驱动编排

📅 2026/8/5 1:27:14
RoboHarness:面向长时程规划异构机器人策略的记忆-驱动编排
26年7月来自华为诺亚、UBC、Toronto大学、Mcgill大学和2012实验室基础模型部的论文“RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning”。长时程机器人任务需要多种能力而单一策略往往无法可靠地提供所有这些能力。异构策略各具优势且互补但要协调这些策略必须应对不确定的能力边界及跨策略分布不匹配等挑战——现有的基于同构、预定义且适用范围固定的技能的规划方法往往忽视了这些问题。RoboHarness这是一个统一框架将独立开发的机器人控制系统封装为可复用的智体技能agentic skills。尽管本研究中该框架是基于视觉-语言-动作模型VLA、强化学习RL策略以及任务-运动规划TAMP系统实现的但其设计初衷是一个通用框架能够兼容更广泛的机器人策略例如导航策略、模型预测控制器和世界-动作模型。RoboHarness 利用多模态执行记忆和在线证据来刻画策略的能力边界从而实现具备能力感知特性的任务分解与策略路由。为了确保策略交接的稳定性该框架的“记忆桥”Memory Bridge模块会检索与下一阶段策略相关的执行轨迹估算该策略的分布内状态区域并引导机器人向该区域移动而无需对策略进行联合重训练。在三个公开基准测试、500 个定制任务以及 135 组真实机器人实验中进行的广泛测试表明其实现有效的能力-觉察路由与稳定的策略协调显著提升了零样本长时程规划能力及分布外OOD鲁棒性。长时程long-horizo​​n机器人任务要求策略能够保持指令对齐、泛化适应环境变化、维持逻辑一致性并具备抗噪鲁棒性Garrett et al., 2020; Yang et al., 2025。尽管近期机器人系统研究已取得显著进展Huang et al., 2026b; Black et al., 2024; Silver et al., 2024; Ye et al., 2025但尚无单一策略能完美满足所有要求各种策略各有利弊。例如视觉-语言-动作模型VLAs具备语义接地semantic grounding和开放词汇指令遵循能力Black et al., 2024; Kim et al., 2025; Zheng et al., 2025但在长时程一致性和几何精度方面仍存在局限。强化学习RL后训练可在特定训练分布内生成闭环行为Zang et al., 2025; Intelligence et al., 2025但在面临分布偏移或奖励函数定义不当的情况下其适用性往往会下降。任务-运动规划TAMP系统提供结构化的逻辑与几何推理能力Silver et al., 2023; Kumar et al., 2023; Liu et al., 2024; Huang et al., 2025但其泛化能力受限于预定义的抽象概念、技能及状态表征。更广泛而言现有策略的能力各有限制没有哪种单一策略能为跨越多种不同能力需求的子任务的长时程任务提供通用解决方案。这促使将长时程任务执行问题构想为多种具有不同能力边界的异构策略之间的协同。面向智体与机器人执行的“驾驭”系统Harness Systems。驾驭系统起源于软件与编程智体领域其核心是将语言模型嵌入执行循环中使其能够调用工具、代码解释器、文件系统、内存、测试工具及利用反馈信号Yao et al., 2022; Schick et al., 2023; Shinn et al., 2023。此类系统为工具调用、状态追踪、迭代优化以及基于中间反馈的纠错提供了外部支撑框架随后扩展至可执行技能库、多智体协作及软件工程智体等领域Wang et al., 2023; Wu et al., 2023; Hong et al., 2024; Wang et al., 2024; Yang et al., 2024; Wang et al., 2025; Xia et al., 2024。近期这一理念被引入机器人领域Li et al., 2026bRoboClaw将视觉-语言-动作模型VLA与管理及调度系统相结合以实现数据采集、任务执行和自我改进。与编程智体相比机器人驾驭系统必须在物理世界的约束下运行Xiao et al., 2026这对底层模型提出了更高的要求。此外机器人智体系统还面临策略异构性的挑战不同的策略族在能力、假设、表征及执行机制上各不相同Zhang et al., 2026; Dalal et al., 2023; Huang et al., 2026a; 2022这使得策略的选择与协调变得复杂。因此现有系统通常仅在固定的执行接口下组织来自同一策略族的技能隐含地假设表征的兼容性与分布内in-distribution的交接Li et al., 2026b; Xiao et al., 2026而未明确解决异构策略的协同调度或能力边界不确定性问题。RoboHarness 旨在填补这一空白提供一种专为异构机器人策略之间具备“能力-觉察”特性的协调而设计的驾驭系统。长时程机器人规划与任务分解。针对长时程long-horizo​​n机器人规划的研究涵盖了分层规划、任务与运动规划、基于技能的规划以及基于语言模型的规划等多种方法Silver et al., 2024; Liang et al., 2024; Athalye et al., 2024; Garrett et al., 2020; Liu et al., 2024; Oswald et al., 2024; Huang et al., 2025。这些方法将高层指令分解为符号化动作、基础技能或子任务序列从而降低了解决长时程操作任务的复杂度。任务与运动规划方法结合了符号化任务推理、几何可行性检查以及预先设计的抽象可复用技能Garrett et al., 2021; Kaelbling Lozano-Pérez, 2011。近期基于语言模型的规划器利用语义知识和指令遵循能力根据自然语言目标生成任务规划并使其适应不同的任务情境Zhao et al., 2023; Yang et al., 2025; Guan et al., 2023; Chen et al., 2024; Hu et al., 2023。然而这些方法大多基于同构技能或策略的假设即各项策略具有预定义、明确且互不重叠的能力它们隐含地假设控制权转移无需额外的中介步骤且不同策略间的输入与输出条件是相互匹配的。因此这些方法未能解决涉及异构策略的长时程规划问题——在此类问题中任务分解、策略分配以及策略间的交接handoff必须进行联合推理。策略链式组合与空间一致性交接。技能链式组合Skill chaining研究了在连接短时程策略以解决长时程任务时出现的分布偏移问题其中相邻策略间的交接往往成为制约性能的瓶颈。既有研究通过学习起始集Konidaris Barto, 2009; Huang et al., 2023、转移机制Lee et al., 2019; Sahni et al., 2017; Mishra et al., 2023或终止状态正则化项Lee et al., 2021来改善某一策略的终止状态与后续策略可执行区域之间的兼容性从而应对这种分布不匹配问题。这些方法表明长程任务的性能不仅取决于单个策略的可靠性还取决于前一策略的终止状态与后一策略可执行区域之间的兼容性。然而这些方法主要属于训练阶段的解决方案需要额外的学习过程或策略正则化而无法实现在线的即插即用式协同。此外这些方法通常假设存在一个能力边界相对明确的共享策略族及既定技能集因而未能充分解决异构策略的分解与调度问题。本文提出一种现有规划方法尚未充分解决的规划问题如何协同独立设计或训练的异构控制策略以解决那些超出任何单一策略固有能力范围的长时程任务。传统的长时程规划方法通常假设存在一组适用范围固定的同构预定义技能Liang et al., 2024; Han et al., 2024; Kaelbling Lozano-Pérez, 2011从而能够在具有明确技能边界的静态技能空间内进行任务分解。相比之下异构机器人策略在架构、输入输出要求、策略假设及执行历史方面各不相同Zhang et al., 2026; Garrett et al., 2021。它们的适用边界往往模糊且依赖于具体情境不同策略的适用范围可能存在重叠而它们的相对性能也会随物体配置、视觉观测、语言指令及执行历史的变化而波动。因此规划器必须根据策略的能力来分解任务并确定在当前条件下哪个策略能可靠地执行各个子任务。此外独立训练或人工设计的策略未必能直接组合一个策略产生的终止状态可能并不处于下一个策略的可执行区域或输入分布范围内Lee et al., 2021; 2019。若在控制权交接时忽视这种不匹配可能会引发分布偏移甚至导致策略交接过程中的级联故障。RoboHarness是一个用于异构机器人策略且具备“能力-觉察”特性的统一规划框架。RoboHarness 将独立训练或人工设计的策略封装为可复用的智体技能模块并辅以描述能力边界及协调特定输入输出要求的辅助模块。为了支持可靠的策略间交接RoboHarness 引入一种名为“记忆桥memory bridge”的链式连接技术该技术结合了记忆检索与空间分布学习以保持空间一致性。这一设计使 RoboHarness 能够根据策略的适用性分解任务并自适应地协调所选策略从而以零样本zero-shot方式完成复杂的长程任务。问题的关键在于协同执行任务分解、基于能力-觉察的策略分配以及策略间的衔接从而确保最终的执行过程能够完成任务 I同时使每个被选定的策略都分配到可行的子任务并接收到符合分布in-distribution的输入。RoboHarness 是一个智体编排框架其中编码智体coding agent充当异构机器人策略的高层规划器与调度器。该编码智体动态调用三类辅助技能信息理解、记忆和自我演化。它通过解读这些技能的结构化输出来分解长时程指令、为子任务分配适宜的策略并协调策略间的必要交接。如图1所示这些辅助技能并不替代底层控制策略而是为实现“具备能力-觉察特性的规划”以及跨不同执行分布的稳定策略编排提供所需的信息、记忆和适应机制。RoboHarness 保留现有策略的原生接口使得独立开发的策略能够进行组合而无需联合重训练或共享动作表征。1 理解技能理解技能进一步解读 RoboHarness 可获取的原始输入包括任务指令、视觉观测、估计的物体位姿、机器人状态以及中间执行结果。其目的不仅限于场景识别而是提取与决策相关的信息揭示当前任务状态与可用策略的能力边界之间的关系。RoboHarness 目前包含五种理解技能并可在需要额外信息时进行扩展。不确定性评估计算滑动时间窗口内估计物体位姿的均值与方差以衡量时间稳定性。视觉上下文评估将当前观测投影到潜空间并将其与特定策略训练轨迹的视觉嵌入进行比较。语义上下文评估采用类似方法将编码后的任务指令及候选子任务与各策略关联的语言描述进行比对。状态-策略兼容性评估利用“记忆桥”Memory Bridge重建的空间分布对当前的末端执行器位姿和关节配置进行评分从而判断机器人状态是否处于下一策略的分布内in-distribution区域。输入质量评估考察图像清晰度、曝光、噪声以及任务相关物体的可见度以确定当前观测是否足够可靠。这些理解技能共同提供结构化的、与任务相关的证据而这些证据仅凭原始输入往往难以可靠地推断出来。编码智体coding agent按需调用相关技能并综合分析其输出结果从而分解任务并将各子任务分配给最合适的策略。2 记忆技能与记忆桥记忆技能包含两个组成部分多模态记忆管理和基于记忆的策略间桥接。记忆管理记忆库 M 组织为一组由节点链接构成的轨迹。轨迹 ξ (n_1, . . . , n_L) 由 L 个按时间顺序排列的节点组成其中每个节点 n 存储子任务指令 g(n)、观测 o(n) 和机器人状态向量 s(n)以及相应的文本嵌入和视觉嵌入。此处d_s 表示机器人状态表征的维度而 e_text 和 e_vis 分别表示文本编码器和视觉编码器。令 V(M) 表示存储在 M 中的所有节点的集合。给定查询子任务 g ∈ G 和观测 o ∈ ORoboHarness 对 M 中的节点执行分层检索。它首先检索那些存储的指令与 g 在语义上最相关的节点随后RoboHarness 将查询观测与 N~ 中节点的视觉嵌入进行比较并检索出 N将整体记忆检索函数表示为 Retrieve_M (g, o) N其中 N 是由上述分层文本-视觉检索过程返回的节点集合。来自这些检索的节点信息会被提供给下游的辅助技能并用于构建“记忆桥”Memory Bridge。此外RoboHarness 还维护着全局历史统计数据用于汇总不同任务中的策略执行结果从而为能力评估和策略分配提供经验依据。在每次执行rollout结束后关联节点轨迹与执行统计​​数据都会持续更新。记忆桥Memory Bridge负责处理策略间的转换即当策略 pi_{k_t} 产生的终止观测 o_t 不在策略 pi_k_{t1} 所支持的输入空间 O_{k_{t1} 内时的情况。如图2 所示给定即将执行的子任务 g_{t1} 和观测 o_tRoboHarness 检索出一组相关的锚点anchor nodes记为 N_t RetrieveM_∞(g_t1, o_t)。基于这些节点记忆桥构建一个局部进度函数并生成一条桥接轨迹 b_t该轨迹引导机器人在调用 pi_{k_{t1} 之前先到达一个观测值位于 O_{k_{t1}} 范围内的交接状态。该过程包含三个阶段。空间分布构建。设 N_t {n_{1,0}, dots, n_{K,0}}其中 K |N_t|n_{i,0} 表示第 i 个检索的节点该节点被视为锚点作为轨迹扩展和进度评分的时间参考。RoboHarness 沿着每个锚点关联的轨迹在时间跨度 l 内向前后两个方向进行扩展。设 n_{i,j} 为与 n_{i,0} 关联且时间偏移量为 j ∈ {−l, . . . , l} 的节点。每个锚点的分值设为零而其关联节点的分值则根据其时间偏移量确定。具体而言RoboHarness 构建机器人状态与分值的配对 (s_{i,j}, y_{i,j})其中s_{i,j} 是存储在 n_{i,j} 中的机器人状态y_{i,j} 是分配给该状态的进度分值。这些配对用于训练一个轻量级进度估计器 f_{score}该估计器预测状态 s 的局部进度。设S_ret,t {s_{i,j}} 表示扩展后的机器人状态样本集。随后RoboHarness 构建局部支持区域 R_conf,t该区域基于状态 s 到其最近的扩展记忆状态的距离来定义即 R_conf,t} 限制学的进度函数使其仅适用于由检索到的记忆提供局部支持的状态。空间状态评分。 RoboHarness 利用 f_score,t 来评估 R_conf,t 区域内的候选机器人状态。尽管在执行“桥接”bridge轨迹的过程中可能会经过该区域之外的状态但这些状态并不被视为有效的交接目标因为其进度估计缺乏来自所检索记忆的充分支持。在 R_conf,t 范围内f_score,t(s) 的符号反映状态 s 相对于所检索锚点anchors的估计局部进度正值表示任务进度较深负值则表示任务进度较浅。因此f_score,t 衡量的是相对进度而 R_conf,t 则界定由下一阶段策略所检索的执行经验支持的、可接受的交接状态集合。桥接轨迹生成。设 s_t 表示策略 π_k_t 执行后的机器人状态并设 S_plan,t 表示采用的运动规划器能够从 s_t 出发并可行地连接到的状态集合。RoboHarness 选取交接目标机器人状态。“支撑约束”确保所选目标位于由检索到的记忆所表征的执行分布范围内而“非负评分约束”则将目标限制在相对于检索到的锚点anchors呈现出向前进展态势的状态上。随后RoboHarness 调用现成的运动规划策略生成一条连接 s_t 与 s*t 的可行桥接轨迹 b_t并在此基础上执行 pi{k, t1}。由此产生的交接过程连同相关的指令、视觉观测及机器人状态轨迹会被存入记忆库 M 中这样其中的节点便可通过RetrieveM操作被检索出来并复用于类似的策略间转换场景。3 自我演化技能自我演化技能利用在线执行过程中的证据通过四种类型的更新来调整 RoboHarness。策略适配Policy adaptation整合现成的适配方法以扩展单个策略的能力例如用于抓取姿态调整的 SIMPACT (Liu et al., 2026) 和用于在线学习新逻辑表示的 PDDLLM (Huang et al., 2025)。编排精炼Harness refinement利用编码智能体coding agent修改编排结构包括任务路由策略、技能调用规则以及技能间的协作方式。参数调优Parameter tuning通过网格搜索调整超参数涵盖内存检索设置、状态评分阈值及桥接接受标准。元数据更新Metadata update根据新观察到的成功与失败案例修订策略能力的元数据。在仿真实验中这四种自我演化机制均处于启用状态但更新仅在系统遇到持续执行失败时触发而非在每次执行尝试后都进行。在此类情况下内存技能会检索相关的失败历史与执行证据并提供给编码智能体随后编码智体决定应采用策略适配、编排精炼、参数调优、元数据更新中的哪一种或几种机制。经验证的更新会被保留并跨越后续评估回合持续生效从而使 RoboHarness 能够积累经验并逐步适应新的任务、物体、场景及环境。4 作为智体技能的异构策略RoboHarness 将每种异构机器人策略封装为可调用的“智体技能”该技能由策略本身及关联的“策略卡”policy card构成。每种策略保留其原生的实现方式、输入及输出无需统一的动作表示与此同时策略卡记录该策略的类型、能力、接口要求、约束条件、假设前提、训练任务以及总结执行结果的历史统计数据。编码智体还能直接检查策略的实现代码从而在元数据摘要之外进一步推断策略的能力与兼容性。这种表示方式使得本质迥异的策略如视觉-语言动作模型 VLA、任务与运动规划器、专用强化学习策略等能够在规划层面进行比较与组合。随着内存中不断积累新的执行证据RoboHarness 会持续更新每张策略卡以细化其能力边界并为后续的规划与策略分配提供支持。1 实验置仿真基准测试中的异构策略除非另有说明RoboHarness 配备三种能力互补且独立开发的策略(1) 在 LIBERO-Spatial、LIBERO-Goal、LIBERO-Long 和 LIBERO-Object 上训练的开源 π0.5 检查点 (Black et al., 2025)(2) 开源 OpenVLA-OFT 检查点 (Kim et al., 2025)该检查点利用 RLinf (Zang et al., 2025) 并在 LIBERO-90 任务上通过组相对策略优化 (GRPO) (Shao et al., 2024) 进行了后训练以及 (3) 针对预定义物体集上的几何约束抓取与放置任务而设计的 TAMP任务与运动规划规划器。基准测试中的仿真评估在三个考察 RoboHarness 不同侧面的公开基准测试上对其进行评估。LIBERO 评估通用的任务遵循性能 (Liu et al., 2023)而 LIBERO-Plus 评估分布外 (OOD) 鲁棒性以及 RoboHarness 刻画其组成策略能力边界的准确度 (Fei et al., 2025)。LIBERO-LoHo 针对零样本长程规划其任务的平均时程horizo​​n约为原始 LIBERO 基准测试任务的四倍 (Huang et al., 2026a)。除了上述基准测试外还设计 500 个涵盖 10 种任务类型的更复杂仿真任务每项任务都需要集成多种异构策略。由于现有公开基准测试中的许多任务仅靠单一策略即可解决因此它们无法充分评估多策略集成的鲁棒性或策略间切换的稳定性。真实机器人实验进一步开展135 组真实机器人实验涵盖五类具有挑战性的任务和四种类型的干扰每项实验均要求协同使用多种异构策略。给定可用积木和语言指令RoboHarness 必须根据要求的结构进行推理并生成组装计划以构建诸如矮桥、高桥、汉字或船只等结构。一些必要的积木最初隐藏在柜子里这就要求机器人打开柜子探查内部物品并取回缺失的积木。2 基线方法将 RoboHarness 与涵盖三种代表性方法类别的综合基线进行比较。VLA 基线包括 π0.5 (Black et al., 2025)、π0 (Black et al., 2024)、UniVLA (Bu et al., 2025)、X-VLA (Zheng et al., 2025)、OpenVLA-OFT (Kim et al., 2025) 和 GR00T-N1.5 (Bjorck et al., 2025)。进一步考察三种世界-动作模型world-action models包括 LingBot-VA (Li et al., 2026a)、Fast-WAM (Yuan et al., 2026) 和 Cosmos Policy (Kim et al., 2026)。此外还纳入三种分层规划方法H-WM (Huang et al., 2026a)、LLM-guided VLA (Shi et al., 2025) 和 logic-guided VLA (Huang et al., 2026a)。通过这些比较RoboHarness 既与端到端策略进行了对比也与专门针对长程决策设计的方法进行对比。评估结果基于 Huang et al. (2026a) 和 Zhang et al. (2026) 的基准测试。