具身智能之NavFoM详解:一个模型同时认路、寻物、跟踪和开车——统一导航路线

📅 2026/7/27 21:45:48
具身智能之NavFoM详解:一个模型同时认路、寻物、跟踪和开车——统一导航路线
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读导航模型通常沿任务和机器人本体分开发展VLN 模型学习听指令穿过房间ObjectNav 模型寻找物体Tracking 模型跟随特定目标自动驾驶模型规划车辆轨迹轮式机器人、四足机器人、无人机和汽车又拥有不同的相机数量、运动尺度与动作空间。每换一个任务或本体输入组织方式和策略头往往都要重做。ICLR 2026 论文NavFoM尝试把这些分支装进同一个 7B 模型。它以一个或多个相机的 RGB 历史、语言指令和任务状态为输入统一输出 8 个未来轨迹点802 万条导航样本覆盖 VLN、目标搜索、视觉跟踪、自动驾驶以及 Web 视频并混合 476 万条图像/视频问答数据。面对相机位置和历史长度的变化Temporal-Viewpoint IndicatorTVItoken 标记“哪一时刻、哪个方向”Budget-Aware Temporal SamplingBATS则在固定 token 预算内优先保留近期画面。一个联合训练 checkpoint 在 7 个公开基准上直接评测不再为每项任务单独微调。RxR 四视角成功率达到 64.4%HM3D-OVON 未见类别上的零样本成功率达到 45.2%EVT-Bench 干扰目标跟踪成功率达到 62.0%。广度并不等于每项都最强NavSIM 的 PDMS 为 84.3低于专用 DiffusionDrive 的 88.1OpenUAV Unseen-Map 的成功率也只有 6.3%。猫先生认为NavFoM 的关键价值是把“通用导航”从共享一个 VLM 主干推进到共享输入语法与轨迹输出接口。TVI 解决不同相机如何进入同一上下文BATS 解决不同任务时长如何挤进同一预算任务专用差异则被压缩到轨迹尺度和本地执行器。它证明了联合训练可以互相增益也暴露了统一模型与专用系统之间仍有性能和部署边界。论文标题Embodied Navigation Foundation Model论文地址https://arxiv.org/abs/2509.12129项目主页https://pku-epic.github.io/NavFoM-Web/会议ICLR 2026图 1NavFoM 用同一模型接收不同相机配置和指令输出导航轨迹或问答文本并展示跨任务、跨本体真机结果。来源论文 Figure 1。原文脉络第 1 节把任务割裂与本体割裂视为通用导航的两条边界第 2 节回顾大模型导航、跨本体策略与跨任务导航。第 3 节依次定义统一轨迹接口、TVI token、BATS、训练数据和系统实现。第 4 节按照 VLN、无人机、寻物、跟踪、自动驾驶和真机实验展开最后用联合训练、相机数量、历史采样和标识 token 消融解释收益。第 5 节将 NavFoM 定位为导航基础模型的起点附录补充轨迹归一化、数据处理与远程部署系统。1—2. 背景与相关工作任务和本体为何难以共用模型已有通用导航研究往往只打通一条轴。Uni-NaVid 等跨任务模型能够兼顾 VLN、ObjectNav、问答和跟随但通常假设相同的室内机器人与相机配置GNM 等跨本体策略可以从多种机器人经验中学习又多集中在固定的 image-goal 或 point-goal 任务。自动驾驶和无人机导航因为尺度、视野与控制变量差异更大通常留在另一套技术栈里。NavFoM 把导航统一为一个条件轨迹预测问题移动本体在时刻 T 接收 N 路第一视角 RGB 历史和语言指令模型预测一组未来 waypoint。地面机器人与汽车的单点动作为(x, y, yaw)无人机增加高度z。这种表示避开轮速、关节角和离散转向定义的差异把各本体的运动学适配留给下游本地规划器。难点随之转移到视觉上下文。同一批 token 可能来自正前方、侧后方或环视相机也可能来自刚刚一秒或几十步之前。直接拼接无法告诉 LLM 每张画面的空间与时间来源完整保留长视频又会让 token 数量和推理时间持续增长。TVI 与 BATS 分别处理这两个问题。3. Method为多相机、多时长和多任务设计统一接口3.1 双分支架构问答生成文字导航生成轨迹图 2图像经过 DINOv2、SigLIP、网格池化和跨模态投影后进入 Qwen2-7B语言头生成回答规划头从 action token 生成轨迹。来源论文 Figure 3。NavFoM 同时保留 QA 和导航两条输出分支。DINOv2 与 SigLIP 分别编码画面特征在通道维拼接后通过两层 MLP 投影到 Qwen2-7B 的 token 空间。图像问答、视频问答和导航因此共享视觉—语言主干QA 分支按自回归方式生成文本导航分支让 LLM 产生一个 action hidden state再由三层 MLP 规划头输出 8 个 waypoint。视觉 token 分为两档。最新画面保留 64 个 fine-grained token用于读取障碍、目标和局部几何历史帧各压缩为 4 个 coarse-grained token用较低成本保存路径上下文。导航损失采用轨迹均方误差QA 使用 next-token 交叉熵两者联合训练。不同本体的轨迹尺度相差很大室内机器人移动数米无人机和汽车的预测范围可达数十米。作者按室内机器人、UAV 和汽车分别设置尺度因子把各维 waypoint 归一化到[-1, 1]再学习。统一的是输出格式不是强迫四种本体共享同一物理尺度。3.1.1 TVI token给视觉序列加上时间与方位图 3TVI embedding 在二维降维图中同时形成时间方向和环形角度结构。来源论文 Figure 4。每组视觉 token 前加入一个 TVI token由三部分相加得到可学习的 base embedding、时间编码以及相机方位角编码。角度编码同时对方位角的正弦和余弦做位置编码使 0° 与 360° 在表示空间中保持相邻不把环形方向错误地拉成一条直线。同一套标识根据任务裁剪信息Image QA 只使用 base表示后面是一张图Video QA 使用 base time标记帧的时间顺序Navigation 使用 base time angle同时标记历史和相机方向。这种“额外插入标识 token”的方式没有直接改写预训练视觉特征。RxR 四视角消融中TVI 达到 64.4% SR普通 viewpoint-history positional embedding 只有 52.3%独立可学习视角 token 为 59.1%。降维可视化与量化结果共同说明模型确实学到了时间顺序和角度的连续结构。3.1.2 BATS固定预算下近期看得细远期留线索多视角视频的 token 数会随导航时长线性增长。BATS 设定总预算 B未超预算时保留全部历史超出后按类似遗忘曲线的指数概率采样越接近当前时刻帧被保留的概率越高同时用 0.1 的概率下限为远期历史留下少量机会。相机增加时每路视觉历史共享同一个总预算算法重新计算采样强度。在 2048-token 设置下BATS 的 RxR SR / SPL / nDTW 为 64.4 / 56.2 / 65.8统一采样为 62.4 / 54.0 / 63.9。预算从 2048 压到 1024 后BATS 的 nDTW 只下降 1.7 个点而统一采样下降 6.0 个点。它没有做复杂的在线 token merging推理耗时也不会随历史无限增长。固定预算也带来竞争关系。相机从 1 路增加到 4 路时性能持续上升扩展到 6 路反而略降更多相机没有带来足够的新视野却占用了原本留给历史帧的 token。BATS 解决“总量失控”还没有解决“不同视角与历史应如何动态竞价”。猫先生认为TVI 与 BATS 是 NavFoM 比“大数据混合训练”更可复用的部分。前者把异构传感器写成 LLM 能识别的视觉语法后者把长时记忆变成显式资源分配模型的通用性不仅来自见过更多数据也来自输入接口允许任务和相机发生变化。3.2 Data1270 万样本如何组成图 4NavFoM 的联合数据包含约 802 万导航样本和 476 万 QA 样本总量约 1270 万。来源论文 Figure 7。导航数据覆盖五个来源VLN 337 万R2R、RxR 室内导航与 OpenUAV 室外指令飞行Object Goal Navigation 102 万从 HM3D ObjectNav 成功轨迹构造Active Visual Tracking 89.7 万来自 EVT-BenchAutonomous Driving 68.1 万来自 nuScenes 与 OpenSceneWeb-Video Navigation 203 万Sekai 的 YouTube 视频、VLM 指令与 SLAM 轨迹。另外混入 315 万图像 QA 和 161 万视频 QA以保留开放世界视觉语言知识。R2R/RxR 采集时还随机化 1—8 路相机、0.6—1.5 米相机高度及 75°—120° 水平视场角为跨相机配置提供训练覆盖。“无需任务专用微调”需要准确理解NavFoM 用一个联合 checkpoint 直接跑所有基准没有在评测前为每项任务再训练但 802 万导航数据本身已经包含 R2R、RxR、EVT、nuScenes、OpenScene 等任务的训练分布。它证明的是联合训练后的跨任务复用并非对所有导航任务都零样本。真正的零样本证据主要来自 HM3D-OVON 开放词汇测试、只用单视角数据训练却切换到四视角评测等设置。3.3 Implementation规模化训练依赖特征缓存训练使用 56 张 NVIDIA H100持续约 72 小时总计 4032 GPU-hours。完整历史若逐帧在线通过两套视觉编码器计算和显存都会迅速膨胀。作者预先缓存每帧 4 个 coarse visual token最新画面和 Image QA 仍在线提取 64 个 fine token使训练速度提高 2.9 倍、GPU 显存降低 1.8 倍。这种缓存适合监督数据已固定的大规模训练却意味着视觉编码器看到的是离线历史表征若未来加入端到端视频增强、在线强化学习或更新视觉主干缓存需要重新生成。4. Experiments广度、迁移与专用模型之间的取舍4.1—4.2 七个基准上的统一评测能力与基准NavFoM 设置代表性结果对照与解释VLN-CE RxR单视角SR 57.4StreamVLN-RGB-only 为 51.8VLN-CE RxR四视角SR 64.4HNR 使用 RGB-D 与里程计SR 56.3HM3D-OVON Unseen四视角、零样本SR 45.2 / SPL 31.9MTU3D 为 40.8 / 12.1EVT Distracted Target四视角SR 62.0 / TR 67.9TrackVLA 为 57.6 / 63.2NAVSIM八视角PDMS 84.3DiffusionDrive 为 88.1VLN、开放词汇寻物和干扰目标跟踪支撑了跨任务收益自动驾驶则说明统一模型可以进入专业任务但还没有全面超过专用架构。OpenUAV 同样呈现边界Unseen-Object SR 为 29.83%Unseen-Map 只有 6.30%。约 300 米的陌生街区需要大范围探索和更高质量 UAV 数据固定长度轨迹预测不能替代地图与探索机制。4.3 真机110 个可复现实验与系统依赖图 55 米 × 5 米环境中的 110 个可复现测试包括 50 个 VLN、30 个搜索和 30 个跟踪案例。NavFoM 成功率分别为 78%、93% 和 86%。来源论文 Figure 10。NavFoM 在三类测试中都超过 Uni-NaVid提升最明显的是跟踪53% 提高到 86%。作者还展示了 Galbot G1、Unitree Go2、Unitree G1 和 NCS-P3 无人机上的长指令执行但这部分主要是定性视频没有给出与 110 个固定案例同等级的跨本体统计。整套真机系统并非一个纯视觉模型直接输出电机控制。机器人压缩并上传多视角 RGB远程服务器生成 8 点轨迹各本体的现成本地规划器再输出速度或关节命令附录明确说明本地 API 必要时可以使用 LiDAR 等传感器。主文写远程 RTX 4090附录和项目页则写 RTX 5090硬件描述存在不一致。1600-token 预算下模型一次轨迹推理最多约 0.5 秒执行与上传采用异步方式。4.4 Ablation多任务数据在互相补能力图 6从单任务数据逐步加入其他导航任务后VLN、搜索、跟踪和驾驶均提升其中跨分布的搜索与跟踪增幅最大。来源论文 Figure 12。搜索任务只用自身数据时 SR 为 10.3%加入全部其他任务数据后达到 45.2%跟踪从 12.6% 提升到 62.0%VLN 从 57.5% 提升到 64.4%驾驶 PDMS 从 79.4 提升到 84.3。多视角、开放目标与不同场景之间确实存在可迁移能力。这组消融同时增加了任务多样性和样本数量没有提供“总样本数相同、只改变任务构成”的严格对照因此无法完全区分数据规模与跨任务协同各自贡献。搜索和跟踪的巨大增幅还与训练—评测差异有关它们的专用训练数据主要是单视角、闭集目标其他任务恰好补充了多视角和开放目标分布。5. Discussion and Conclusion导航基础模型的起点与边界NavFoM 把四类任务、四类移动本体、1—8 路相机和长短不一的视觉历史组织成一个可训练接口。TVI 负责说明 token 的时间与方向BATS 控制历史成本fine/coarse 双尺度保留最新细节与远期线索轨迹归一化和本地规划器吸收本体差异。联合数据最终让一个 checkpoint 覆盖 7 个公开基准。“Foundation Model”仍是一项目标而非已经完成的事实。模型依赖 1270 万监督样本、4032 H100 GPU-hours 和远程高端 GPU专业自动驾驶性能未领先UAV 陌生地图探索仍弱跨本体真机证据以定性展示为主规划头也只是预测短期 8 点轨迹。代码与模型权重在论文及项目页中尚未给出公开入口可复现性仍取决于后续发布。猫先生认为NavFoM 让人看到了一种比“每个机器人训练一个 VLA”更可扩展的导航路线视觉语言主干共享通用认知TVI 和 BATS 规范异构观测轨迹接口连接不同本体。下一步的关键不只是继续扩大混合数据而是验证模型能否迁移到训练数据里从未出现的新任务、新相机拓扑和新运动学本体并在相同数据量下证明跨任务协同确实来自能力迁移。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列