大家读完觉得有帮助记得关注和点赞关键词视觉-语言导航无人机强化学习摘要无人机视觉-语言导航UAV-VLN致力于使空中智能体能够根据自然语言指令从自身第一人称视觉观测出发在开放的 3D 环境中完成导航。当前方法存在三个相互耦合的问题视觉观测中与指令相关的地标落地能力弱、对长航程历史的探索不充分、以及在局部陷阱或重复探索下决策不稳定。为解决这些问题我们提出了统一的语义到决策框架。首先我们提出指令引导的语义增强模块将目标级语义与相对空间线索注入当前观测状态。随后我们设计了相关性感知的动态时间聚合策略在对完整历史缓存重新加权的同时将少量高相关帧转换为结构化的地标提示送入解码器。最后我们提出拓扑感知的决策方法将局部最优认知与基于进度、目标、语义和路径约束奖励的组相对策略优化GRPO相结合。在广泛使用的 AerialVLN 和 OpenFly 基准上的实验清楚地表明我们的方法达到了当前最优性能。代码开源于https://github.com/mksasx/S2D-UAV-VLN1 引言视觉-语言导航VLN研究具身智能体如何在局部视觉观测下遵循自由形式的语言指令[1]。对于无人机UAV而言这一任务要困难得多因为智能体必须在开放的 3D 环境中进行推理面临剧烈的尺度变化、稀疏但决定性的地标以及比室内或地面场景长得多的轨迹。该能力对于巡检、搜索与救援、物流以及城市监控具有重要意义——在这些场景中自然语言为非专业操作员提供了灵活的接口尽管本工作评估的是基于仿真的高层导航而非真实世界的无人机部署。近期的空中研究涵盖了基准式 UAV-VLN 数据集、高保真仿真平台、大规模合成工具链、城市尺度的真实世界空中导航语料、低空智能体应用系统以及对空中具身智能体的更广泛研究[10, 18, 21, 24, 28, 34, 37, 44, 51]。这些资源推动了可度量的进展近期基于 VLM/MLLM 的系统如 CityNavAgent、FlightGPT、GeoNav以及当代的开放世界、端到端或结构化视角空中变体如 OpenVLN、UAV-VLN、基于网格的空中 VLN都展示了更强的多模态推理在长航程空中导航中的潜力[3, 21, 29, 42, 48, 50]。尽管取得了这些进展长航程 UAV-VLN 仍然遭受着一条耦合的失败链。当前视角下的落地是脆弱的因为空中地标通常较小、重复且视觉上模糊导致全局图像特征忽略了直接决定下一步动作的目标短语。一旦落地发生漂移历史帧聚合就会变得充满噪声因为许多存储的帧不再与当前活跃的子目标相关。由此产生的时序状态破坏了序列决策的稳定性导致重复探索、语义上看似合理但实际上错误的停止或在视觉相似区域中的局部循环。图1长航程 UAV-VLN 任务示意图。示例路线表明成功的导航依赖于准确的地标落地、相关性感知的历史选择以及稳定的拓扑感知决策。这些错误并非源自三个孤立的模块而是反映了状态构建这一单一核心问题。与近期主要强化规划器侧推理或由粗到精地理空间搜索的空中智能体不同[3, 42]我们关注的是策略状态本身落地质量决定了哪些过去观测仍然有用时序相关性控制着策略是否接收到干净的状态而状态质量则支配着拓扑感知决策的稳定性。相应地我们将空中导航形式化为一个渐进的语义到决策流水线。如图 2 所示我们的框架首先从地标语义、相对空间线索和局部拓扑构建指令引导的观测令牌然后通过相关性感知的动态时间聚合选择性地复用历史证据最后通过拓扑感知的局部最优恢复和基于 GRPO 的策略优化来精炼动作选择。图 1 展示了激发这一设计的任务抽象。本工作的核心贡献总结如下我们提出了面向长航程 UAV-VLN 的统一系统级语义到决策框架将指令引导的当前视角感知、相关性感知的时序聚合和拓扑感知的动作精炼耦合在一起。我们设计了两个独特且互补的机制即动态时间聚合DTA和局部最优认知LOC。其中 DTA 将指令条件的完整历史加权与稀疏地标提示相结合LOC 检测拓扑层面的停滞并有条件地注入语义匹配的边界线索。它们与复合轨迹奖励一起提升了长航程导航中的决策稳定性和鲁棒性。我们在 AerialVLN 和 OpenFly 上验证了所提出的框架结果清楚地表明了语义落地、时序聚合和拓扑感知决策优化这一耦合设计的有效性。2 相关工作2.1 视觉-语言导航VLN 起源于室内和地面场景其中智能体在更密集的局部线索和较短的轨迹下导航[1, 5, 9, 17]。UAV-VLN 更加困难因为智能体必须在开放的 3D 环境、剧烈的尺度变化、稀疏地标以及长得多的指令跨度上进行推理。空中基准生态系统已经在多个方向上扩展AerialVLN 和 OpenFly 提供了基准式的长航程评估OpenUAV 引入了更真实的仿真平台以及 UAV-Need-Help 基准CityNav 面向真实世界的城市尺度空中导航[10, 18, 24, 37]。近期的研究进一步将这一空间拓展到开放世界空中 VLN、端到端 UAV-VLN 流水线、面向配送的低空导航、双智能体空中 VLN以及通用的空中具身智能体系统[21, 29, 40, 44, 49, 51]。相关的空中努力包括空中视觉对话导航和一言起飞控制在不同于序列长航程指令跟随的任务假设下拓宽了模态和部署空间[8, 36]。共同的教训是从地面 VLN 继承的方法必须针对空中模糊性、更长的记忆跨度和更脆弱的序列决策重新设计。图2所提出的语义到决策流水线概览。模型对观测、指令和拓扑上下文进行编码执行语义-空间增强和带稀疏落地提示分支的动态时间聚合DTA并在下一步动作预测前进行局部最优恢复LOC和基于 GRPO 的决策优化。2.2 空中导航中的语义落地与历史建模前两个瓶颈是细粒度语义落地和选择性历史建模。较小或相似的实体、域偏移和有限的标签对无人机检测提出了挑战[7, 15, 20, 38, 39]因此粗粒度对齐可能会错过决定下一步动作的地标短语。地面 VLN 方法如 RCM、实体图推理和 HAMT 改善了跨 VLN 设置的令牌级对齐和历史使用[5, 12, 35]。更近期的通用领域 VLN 工作如 FlexVLN、SmartWay、NavMorph 和 NavForesee 也强化了跨任务适配、回溯感知推理以及更有结构的导航历史预测性使用的需求[22, 32, 45, 47]。空中研究从不同角度暴露了相同的失败模式AerialVLN 引入了带前瞻引导的循环空中策略FELA 在空中视觉对话导航中强化了细粒度对齐STMR 和 CityNavAgent 依赖更强的语义推理FlightGPT 强调基于 VLM 的可解释规划NaVid 表明基于视频的状态构建可以改善长航程泛化[3, 11, 24, 33, 46, 48]。第二个挑战是在子目标完成后并非所有历史观测仍然有用。历史感知的 VLN 模型如 DUET 表明选择性记忆在连续导航中至关重要而空中系统如 OpenFly-Agent、SkyVLN 和 FlySearch 进一步支持了关键帧或探索感知推理[6, 10, 19, 25]。我们的设计明确地分离了这些角色它首先构建指令引导的当前视角令牌然后才应用带稀疏落地侧分支的相关性感知时间聚合。2.3 拓扑感知规划与策略优化即便有了更强的感知和记忆当决策状态不够稳定以避免循环、错误停止或语义上看似合理的绕路时长航程 UAV-VLN 仍然会失败。拓扑推理在 VLN 中很有用因为它稳定了长程探索暴露了边界结构并减少了局部模糊性[4, 26]。在空中导航中STMR 和 CityNavAgent 使用结构化空间先验GeoNav 引入双尺度地理空间推理用于由粗到精的空中搜索Fly0 将语义落地与几何规划解耦[11, 42, 43, 48]。邻近的基于地图或面向控制的系统如 SkyVLN 和 UAV-Flow 改善了全局一致性或底层执行但它们将问题重新表述为位置预测、地图搜索或控制而非基准式的序列策略学习[19, 36]。FlightGPT 进一步探索了面向空中 VLM 智能体的 GRPO 风格的后训练但其重点仍然是推理过程监督而非拓扑条件的状态精炼[3]。因此我们的目标比通用空中推理更为聚焦我们将语义落地、相关性感知时间聚合和拓扑感知决策优化连接为一个用于序列长航程 UAV-VLN 的策略状态流水线。3 提出的方法3.1 问题形式化我们将 UAV-VLN 形式化为指令条件的部分可观测马尔可夫决策过程POMDPM(S,A,P,O,Ω,r,γ)其中 P 和 Ω 分别是转移和观测模型。一个回合包含指令 L{w1​,...,wN​}、初始隐状态 s1​∈S以及隐藏目标区域 g。在步骤 t策略接收第一人称 RGB-D 观测 ot​(It​,Dt​) 以及回合局部坐标系下的机载位姿估计 q^​t​(x^t​,y^​t​,z^t​,ψ^​t​)。它保留 Ht​{(oτ​,q^​τ​)}τ∈Bt​​其中 Bt​{τ∈N∣max(1,t−H)≤τt}且 B1​∅并从这些估计位姿更新拓扑图 Gt​(Vt​,Et​)。其策略信息状态为其中一次展开为 ξ(x1​,a1​,...,xT​,aT​,xT1​)。位姿估计 q^​t​ 由已执行的自我运动和仿真器的里程计等价机载流如深度加 IMU/GPS/VIO维护不含目标坐标。这种传感器侧的分离与 RGB-D 空中基准和真实无人机传感器平台一致[24, 37]。相比之下st​ 是特权仿真器状态仅由转移、奖励和评估接口使用。解码器上下文 ctdec​ 由当前观测编码器输出、DTA 过滤后的历史表示、从关键历史帧提取的结构化提示以及 LOC 产生的拓扑感知目标构建而成。因此动作策略写为在离散动作空间 A 上的 πθ​(at​∣ctdec​)该空间包含可达的运动选择和停止动作。由于奖励依赖于动作后的进度和停止行为实例化的步骤奖励为 rt​r(st​,at​,st1​;g)。带折扣的回报 R(ξ)∑t1T​γt−1rt​训练目标为其中 rt​ 的复合形式在第 3.4 节定义。在整个方法中st​,q^​t​,xt​,f^​t​,h~t​,ptrag​ 和 vt⋆​ 分别表示隐仿真器状态、策略可访问的局部位姿估计、策略信息状态、指令增强的当前观测特征、DTA 过滤后的历史表示、从关键历史帧构建的结构化历史提示以及 LOC 选择的拓扑感知边界目标。由此产生的建模问题是如何将 xt​ 转换为在长跨度上既语义忠实于指令又拓扑鲁棒的决策上下文。我们通过三个标准 VLN 指标评估轨迹性能包括导航误差NE、成功率SR和先知成功率OSR。3.2 框架概览图 2 总结了完整流水线观测视觉指令编码 → 细粒度语义与空间增强 → 动态时间聚合DTA→ 局部最优认知LOC→ 基于 GRPO 的策略精炼。为清晰起见我们将这些操作分为三个宏观阶段。阶段 1​ 从 RGB-D 观测、视觉编码器和拓扑编码器构建指令引导的当前状态。阶段 2​ 对保留的历史执行 DTA并用稀疏落地分支增强加权主分支该分支将最多两个高相关帧转换为结构化提示记忆。阶段 3​ 监控演化的拓扑图检测停滞并有条件地向解码器提供语义对齐的边界线索。GRPO 随后在训练期间在复合奖励下精炼可训练策略在推理期间被移除。这种分解保留了明确的因果角色当前视角落地决定了智能体在当前步骤应关注什么DTA 过滤相关的历史证据LOC 定义了拓扑何时为下一步动作提供信息。3.3 指令引导的感知与时序建模观测视觉指令编码器。​ 当前视角编码器以 RGB 图像 It​ 作为输入产生与指令无关的视觉令牌而文本编码器生成指令令牌和指令查询。对齐的深度图 Dt​ 不被作为额外的颜色通道纳入而是由空间线索分支使用。拓扑图被并行编码并在语义-空间增强后与落地观测融合。历史、当前观测和指令流在送入解码器之前通过[HIS]、[OBS]和[NAV]标识符保持可区分。具体的骨干网络选择在第 4.2 节描述。细粒度语义与空间增强。​ 令 ftbase​∈Rdh​ 表示从 RGB 图像 It​ 生成的基础当前视角令牌。同时目标检测器从 It​ 中提取 Kt​ 个地标候选 {(btk​,vtk​)}k1Kt​​其中 btk​ 是地标区域vtk​∈Rdo​ 是其语义描述符。令 d~tk​ 为对齐深度图 Dt​ 在区域 btk​ 内的有效值中位数。给定相机标定 C我们在深度 d~tk​ 处反投影候选中心并将得到的三维点 utk​ 转换到无人机机体坐标系。定义 uˉtk​utk​/dsens​我们将相对空间关系编码为其中 ϑtk​ 是机体坐标系中的方位角ρˉ​tk​、ζˉ​tk​ 和 αˉtk​ 分别是裁剪归一化距离、垂直偏移和框尺度。框尺度为 ∣btk​∣/(W⋅H)​其中 W×H 是图像尺寸空间坐标由传感器范围 dsens​ 归一化。无效深度的候选使用学习的未知空间嵌入。由此产生的线索因此集成了深度衍生的方位角和相对 3D 位置与图像空间框尺度。文本编码器输出指令令牌矩阵 HLtok​∈RN×dh​ 和池化指令查询 eˉL​∈Rdh​。地标相关性建模为指令引导的当前视角特征变为当没有保留的候选时Kt​0目标残差设为零得到 f^​t​LN(Wg​ftbase​)。该模块将细粒度的目标级语义和相对位置线索注入当前观测防止状态被粗粒度全局外观主导。视觉-拓扑融合。​ 长航程空中导航还依赖于结构可达性。我们对演化图进行编码以获得节点嵌入 {utm​}m1∣Vt​∣​将它们堆叠为矩阵 Ut​并通过交叉注意力计算融合的当前状态令牌这里f^​t​ 携带来自当前视角的细粒度语义证据而 Ut​ 编码了无法仅从外观恢复的局部可达性和邻域结构。交叉注意力突出了既空间相邻又与落地指令语义对齐的图节点。令牌 ht​ 既是指令引导的又是拓扑感知的为后续的决策模块保留了清晰的接口。相关性感知的动态时间聚合。​ DTA 聚合由 Bt​ 索引的所有帧同时仅对高权重关键帧进行落地。以 eˉL​ 为查询它为 τ∈Bt​ 计算相关性权重DTA 主分支将加权的完整历史缓存与当前观测结合获得过滤后的时序状态这个主分支是导航策略使用的循环状态通路。此外DTA 包含一个稀疏关键帧落地分支以捕获延迟的地标线索。我们首先选择高权重历史索引集合其中在所有报告中 Kr​2。对于空的初始缓存历史求和与 mt​ 设为零且 It​∅。当缓存只包含一个帧时选择该单帧。否则对选定的 RGB 图像应用冻结的落地模型其类别-区域输出通过与 ϕ 配对的对齐深度图3带稀疏落地的动态时间聚合概览。指令查询为历史观测分配相关性权重以生成聚合的历史表示而 top-K 帧被转换为带相对位置线索的结构化地标提示。对于 τ∈It​。每个元组由此编码了地标类别、图像区域和深度衍生的相对位置。这些落地的元组被序列化为结构化历史提示并进一步编码为辅助解码器记忆提示还插入了每个选定帧的简短描述符确保解码器同时接收帧级上下文和地标级结构。加权聚合分支输出 h~t​ 作为主时序状态而稀疏落地分支输出 ptrag​ 及其编码记忆 mt​ 作为辅助提示上下文。因此DTA 不仅仅是一个 top-K 检索模块而是一个带有关键帧落地侧分支的加权聚合模块。3.4 拓扑感知决策优化在电流视角落地和时序过滤之后剩余的挑战在于决策鲁棒性即便是一个精炼良好的语义状态仍然可能诱导局部循环或语义上看似合理但无效的绕路。为缓解此问题我们提出了拓扑感知的局部最优认知LOC和基于 GRPO 的策略优化。局部最优认知。​ 令 Vtexp​⊆Vt​ 表示当前动态拓扑图中的已探索节点Ft​⊂Vt​ 表示仍未探索的可达边界节点。LOC 监控探索图是否在最近 Δ 步内扩展。对于 t≥Δ当该窗口内没有出现新探索节点时检测为停滞对于非空的 Ft​令 evnode​∈Rdh​ 和 vt​ 分别表示边界节点 v 和当前图节点的语义嵌入。LOC 在 Ft​ 上对语义一致性和图距离进行归一化。以距离极值 dtmin​ 和 dtmax​ 以及常数 ϵloc​0它计算这两个归一化项分别表示指令兼容性和相对遍历代价并被等权加权。当 LOC 激活且边界集合非空时解码器线索将所选节点编码为 etloc​Encloc​(vt⋆​)否则它设为零向量。复合奖励设计。​ 转移奖励平衡四项进度奖励、目标完成奖励、语义匹配奖励和路径合规惩罚定义为目标区域 g 和与基准一致的距离 d(s,g) 仅对仿真器侧的奖励和评估模块可用不包含在 ctdec​ 中。为防止以米为单位的距离主导有界的语义和终止项我们定义回合归一化距离为 dˉt​clip(d(st​,g)/Dξ​,0,1)其中 Dξ​max{d(s1​,g),ϵn​}。进度项奖励智能体向目标移动目标完成项在智能体到达目标区域并执行停止动作时分配终止奖励语义匹配项对到达观测的图像-文本一致性评分ψI​ 和 ψT​ 是用于奖励计算的冻结 CLIP 图像和文本编码器。同一个冻结图像编码器被重用用于在描述符空间中比较观测。路径合规项惩罚回溯和对目标的持续偏离。令 tw​max{1,t−w} 表示重访窗口中的第一个索引其中偏离计数器初始化为 n1dev​0 并按如下演化重访指示器定义为这里 d3D​ 仅使用估计局部位姿的位置分量z^t​ 是高度分量ϵg​ 是成功半径svis​(t,j)∈[0,1] 是冻结全局图像描述符之间的归一化余弦相似度。这种基于描述符的验证在学习的嵌入空间中比较观测消除了跨不同相机视角对检测框进行像素坐标对齐的需要。联合的估计空间、高度和视觉测试抑制了由附近但视觉上不同的位置引起的错误重访匹配。由于 dˉt​,nˉtdev​∈[0,1]进度和持续偏离项都与路线长度和度量尺度无关地独立有界。基于 GRPO 的策略精炼。​ 用于动作预测的解码器上下文组装为其中 HLtok​ 是上述定义的指令令牌矩阵其余输入是 DTA 状态、结构化提示记忆和条件 LOC 线索。我们不训练单独的评论家网络而是采用 GRPO 在此解码器上下文上进行策略精炼[3, 30, 31]。对于每个指令和起始状态我们从 πθold​​ 采样一组 M 条轨迹 {ξi​}i1M​并计算组归一化优势为其中 ϵA​0 处理相同的组回报。裁剪的 GRPO 代理定义为其中这里 Ti​ 是轨迹长度。旧策略 πθold​​ 是仅用于重要性比率的展开快照在更新轮次之间刷新而 πref​ 是 GRPO 微调开始时行为克隆策略的冻结副本。每决策 KL 散度项将学习到的策略锚定到监督初始化而裁剪约束了相对于展开策略的每次更新。最大化 JGRPO​ 将策略精炼与 DTA 状态、稀疏提示记忆和 LOC 线索耦合起来。3.5 训练与推理对于训练我们首先用专家轨迹上的行为克隆初始化解码器确保策略从稳定的指令跟随机制开始 GRPO 微调其中 at⋆​ 是专家动作ctdec​ 遵循上述解码器接口。然后我们用 GRPO 微调可训练策略模块得到在推理期间系统首先对当前 RGB 图像和指令进行编码推导基于深度的语义-空间线索并将落地观测与局部拓扑融合以获得 ht​。DTA 然后对保留的历史加权以生成主时序状态 h~t​同时其稀疏分支将最多两个高相关历史 RGB-D 帧转换为结构化提示 ptrag​ 和辅助记忆 mt​。当 LOC 检测到停滞且存在可达边界时它有条件地将所选边界线索 etloc​ 附加到解码器上下文。解码器从 ctdec​ 预测下一步动作。GRPO 组采样和策略更新仅用于训练不是推理路径的一部分。4 实验结果与分析4.1 数据集与评估指标AerialVLN。​ AerialVLN[24] 包含城市尺度的连续无人机轨迹带有长自然语言指令是最早的 UAV-VLN 基准之一。我们在公开的 seen 和 unseen 划分上报告 AerialVLN-S 验证性能使用 NE、SR 和 OSR。OpenFly。​ OpenFly[10] 是一个大规模空中 VLN 基准包含跨 18 个场景、由多个引擎和表示渲染的 100K 条轨迹。我们的模型在 OpenFly 训练集上训练并在基准的标准评估协议下在测试集上评估。我们报告三个标准指标导航误差NE测量到目标的终端直线距离成功率SR表示在目标 20 米内停止的回合比例先知成功率OSR表示在任意轨迹步骤进入该半径的回合比例。4.2 实现细节我们利用通过 MMRotate[53] 的 Oriented R-CNN[41] 进行当前视角增强利用 Grounding DINO[23] 进行稀疏历史落地利用带 LoRA[14] 的 Qwen2.5-VL-7B[2] 作为动作解码器利用冻结的 CLIP[27] 进行奖励和重访描述符以及轻量级 GCN[16] 进行拓扑建模。所有主要结果在三个随机种子上平均。完整的几何、历史、训练、奖励、重访、参数数量和执行效率配置在补充材料中提供。4.3 与强基线的比较在 AerialVLN-S 验证集上。​ 表 1 中的比较结果显示了从早期循环基线如 Seq2Seq、CMA到 SOTA 空中推理系统的清晰演进表明长航程 UAV-VLN 依赖于准确的地标落地、有效的历史建模和稳定的序列决策。我们提出的框架在两个验证划分上都实现了最高的 SR在 seen 划分上实现了最高的 OSR同时在 NE 方面保持竞争力。unseen 划分是一项严格的压力测试因为分布偏移放大了地标模糊性和长航程误差累积。与 Fly0[43] 相比我们的方法将 unseen SR 从 60.07 提升到 61.38将 NE 从 51.23 降低到 50.69。三个种子的结果可靠地量化了我们方法的运行间方差但它们不构成针对来自单独报告的基线值的配对显著性检验。unseen 划分上的 SR-NE 权衡可视化于图 4。在 OpenFly 上。​ 我们的模型在 OpenFly 的官方训练划分上训练并在标准协议下在测试集上评估。如表 2 所总结我们的方法在所有报告的方法中实现了最低的 NE 以及最高的 SR 和 OSR。与 Fly0[43] 相比我们的方法将 NE 从 29.47 降低到 26.14将 SR 从 64.67 提升到 67.31将 OSR 从 72.81 提升到 77.32。更显著的性能提升可能归因于其细粒度地标和路线线索。AerialVLN-S 测试划分NE 53.5SR 59.0OSR 69.0和 OpenFly 验证划分NE 25.0SR 68.5OSR 78.5的额外三种子平均结果详见补充材料。图4AerialVLN-S 验证集 unseen 划分上的 SR-NE 比较。每个标记表示一个方法更高的 SR 和更低的 NE 表示更好的性能。我们的完整模型为清晰而突出显示。表 1AerialVLN-S 验证集 seen 和 unseen 划分的性能比较。最佳结果以粗体突出显示第二佳结果以下划线标出。方法验证 Seen验证 UnseenNE↓SR↑OSR↑NE↓SR↑OSR↑Random109.600.000.00149.700.000.00ActionSampling213.800.905.70237.600.201.10Seq2Seq[1]146.004.8019.80218.902.3011.70CMA[24]121.003.0023.20172.103.2016.00LAG[24]90.207.2015.70127.905.1010.50STMR[11]63.8230.1556.3097.8618.3533.40CityNavAgent[48]66.3428.9758.10100.3116.7031.90NavGPT[52]59.4134.0461.2091.6026.5046.20SPF[13]40.1245.8972.3871.3435.1258.30OpenFly-Agent[10]66.9336.9861.8090.6729.3147.80UAV-Flow[36]58.1635.8158.3482.3828.8546.10Fly0[43]27.1970.4381.2051.2360.0769.22FlightGPT[3]38.1744.6272.9862.8831.7560.09Ours​28.34​71.12​82.60​50.69​61.38​71.01​表 2OpenFly 测试集性能比较。最佳结果以粗体突出显示第二佳结果以下划线标出。方法NE↓SR↑OSR↑Random165.380.000.00OpenUAV[37]74.6317.8131.16UAV-Flow[36]69.5132.1444.01AerialVLN[24]94.636.7119.91OpenFly[10]64.0833.6149.72NavGPT[52]61.5729.2843.48STMR[11]66.5427.4342.64CityNavAgent[48]70.2425.3339.75SPF[13]46.5742.9455.79Fly0[43]29.4764.6772.81FlightGPT[3]41.2956.2369.03Ours​26.14​67.31​77.32​4.4 消融研究表 3 报告了在 AerialVLN-S 验证集 unseen 划分上的固定顺序累积添加。NE、SR 和 OSR 增益上一致的单调改善清楚地验证了我们的耦合流水线设计的有效性。额外的留一法和替代历史结果表明没有 DTA 时 SR 为 46.74没有 LOC 时 SR 为 50.90使用简单历史聚合时 SR 为 55.43而完整模型为 61.38。奖励消融显示相对于基础 GRPOSR 57.42的一致增益仅语义、仅进度、仅目标/停止和仅路径合规分别获得 58.52、59.52、58.24 和 58.91 的 SR而完整复合奖励达到 61.38。在高斯图像噪声 σ0.10 下我们的模型产生 NE 58.40、SR 55.10 和 OSR 64.85。在中等累积定位漂移下我们的方法达到 NE 56.71、SR 56.98 和 OSR 66.23。完整的协议、指标和评估边界在补充材料中总结。表 3AerialVLN-S 验证集 unseen 划分上的累积消融。每行按流水线顺序向相同基础模型添加一个组件。最后一行对应于我们的完整模型并与表 1 中报告的验证集 unseen 结果匹配。变体NE↓SR↑OSR↑Baseline72.1035.8559.92 语义增强67.8440.9662.88 DTA62.11—— 稀疏落地58.2751.3256.47 LOC54.0656.4766.41 GRPO完整50.69​61.38​71.01​4.5 定性分析图 5 展示了一个代表性的成功案例。智能体沿着主路前进经过左侧的喷泉在红顶建筑处右转并停在钟楼旁的小广场上方。轨迹遵循指令中描述的图5所提方法成功导航回合的定性示例。它展示了指令、四个第一人称无人机观测以及相应的俯瞰轨迹。智能体遵循指定的地标顺序并在目标区域附近终止。地标顺序说明了语义连贯的长航程执行。4.6 讨论实验结果支持将长航程 UAV-VLN 视为策略状态构建问题而非独立的感知、记忆和规划子问题的观点。跨越 AerialVLN-S 和 OpenFly 的结果连同消融研究一致支持将指令引导的观测、选择性历史和拓扑线索作为一个耦合的策略状态。这些结果应在评估设计的背景下理解三种子统计量化了运行间稳定性表 3 报告了累积添加而补充实验进一步验证了 DTA 和 LOC 的效果。对外部感知、机载位姿和轻量级拓扑的依赖促使我们在基准导航之外开展进一步的部署导向验证。5 结论本工作提出了一个统一的语义到决策框架将当前视角落地、相关性感知的时间聚合和拓扑感知的决策精炼连接起来用于长航程 UAV-VLN。DTA 通过稀疏地标提示保留了保留的历史并恢复了延迟的语义线索。LOC 在拓扑指示停滞时有条件地提供边界线索。在 AerialVLN-S 和 OpenFly 上的大量实验连同组件、奖励、模拟图像噪声和定位漂移分析验证了这些模块作为一个耦合的状态构建过程发挥作用从而实现更稳定的长航程导航行为。未来工作将在更具挑战性的真实世界条件下评估我们的框架包括恶劣天气、动态障碍物、更强的传感器耦合感知/定位损坏以及真实的闭环飞行同时探索更丰富的语义-几何记忆和更广泛的跨环境验证。