ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1: Toward a General Visual Language Navigation Foundation Model
来自 Alibaba AMAP CV Lab
摘要
视觉语言导航基础模型旨在将深层推理与空间决策统一,同时具备广泛适应性以应对多种具身任务。当前方法通常通过将观测直接映射到动作的单一策略来实现这种整合,但常受坐标漂移和长尾语义处理不佳的困扰。此外,这些黑箱映射缺乏可解释性,阻碍了通用性、鲁棒性和透明性的同步实现。我们提出ABot-N1,这是迈向通用视觉语言导航基础模型的一步,通过双视觉语言信号引导的慢-快架构将认知与控制解耦,从而解决上述挑战。具体而言,慢速视觉语言推理器执行显式思维链推理,同时生成像素目标。这一紧凑的图像空间锚点集作为通用接口,适用于多种任务,包括点目标、物体目标、兴趣点目标、指令跟随和人物跟随。随后,快速动作专家利用文本线索和像素引导,以原生控制频率生成连续航点。通过像素级锚点与显式语言轨迹的配对,桥接高层意图与低层控制,我们的方法在仿真和真实世界基准测试中实现了鲁棒、可泛化且可解释的导航。ABot-N1建立了新的最先进记录,尤其在城市场景导航中取得显著提升:兴趣点到达率提升35.0%(达到77.3%),在复杂室内外场景中分别实现95.4%和92.9%的成功率。在物体到达、人物跟随和指令跟随任务中,它同样保持了卓越的鲁棒性。新的点目标/兴趣点目标基准已作为开源资源发布,以推动城市场景导航领域的发展。
译自 Hugging Face · Daily Papers · arXiv:2607.10383 · 录于 二〇二六年七月十四日