ECCV 2026|AgentVLN:让机器人导航进入Agent时代
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
例如,机器人完成一句简单的指令:
“穿过走廊,在窗户旁边找到椅子。”
机器人不仅需要 “理解” 这句话,还需要知道:“走廊在哪里? 窗户和椅子之间是什么空间关系?当前视角是否被遮挡?应该先往哪里移动?接近目标时如何避免碰撞?” 这就是视觉语言导航(Vision-and-Language Navigation, VLN)面临的核心问题:如何让智能体将自然语言指令转化为现实世界中的连续行动。
为此,AgentVLN 提出 “VLM-as-Brain” 的理念,让 VLM 负责高层认知决策,同时通过模块化技能库完成具体执行,从而实现更加高效、灵活的机器人导航,即:VLM Agent → Skill Calling → SLAM/Perception → Robot Navigation。
论文提出的 AgentVLN 在 R2R-CE 和 RxR-CE 等主流 VLN 基准上取得领先性能,同时仅使用 3B 规模模型,并支持 Jetson 等边缘设备实时运行。 该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用。
论文标题:AgentVLN: Towards Agentic Vision-and-Language Navigation
代码链接:https://github.com/Allenxinn/AgentVLN
项目主页:https://allenxinn.github.io/AgentVLN/
数据集链接:https://huggingface.co/datasets/allenxinn/AgentVLN-Instruct
核心思路
AgentVLN 使得机器人不再要求一个巨大模型直接完成所有事情,而是让视觉语言模型负责:“理解任务目标、分析环境与调度不同技能”。 而具体执行,例如建地图、避障、移动和定位等功能则交给专门设计的技能模块完成。该工作将导航过程建模为部分可观测半马尔可夫决策过程,并将技能划分为感知层技能和规划层技能,让智能体根据环境状态动态调用不同能力。这种设计类似人类完成导航任务的方式:
看到环境 → 思考路线 → 行动 → 根据反馈调整。
机器人不需要每一步都重新学习,而是像人一样调用已有能力。同一个 AgentVLN “大脑”,可以根据不同机器人的身体能力,替换对应的底层技能模块,从而快速适配不同机器人平台。
通过插件式底层技能库设计,AgentVLN 可以在不重新训练大规模视觉语言模型的情况下,通过扩展或替换技能实现对新环境和新任务的适应。
把 3D 世界 “翻译” 为 VLM 能看懂的 2D 提示
视觉语言模型最大的优势,是理解二维图像中的语义信息。 但机器人导航的问题在于:真实世界是三维的。机器人需要知道:“应该往哪里走?”,而 VLM 看到的是:“图片里的哪个位置代表目标方向?”,如何连接这两个空间,一直是机器人自主导航领域的重要挑战。
为此,AgentVLN 提出: 跨空间表示映射机制(Cross-space Representation Mapping)。其核心思想是:先利用 SLAM 作为感知技能计算真实环境中的可行路径,再将三维路径信息映射回二维图像空间,让 VLM 直接在视觉空间中进行决策。
机器人首先调用感知技能,对当前环境进行分析:1)构建三维空间地图;2) 获取环境拓扑结构;3)计算可通行区域;4)生成候选导航路径点。 随后,AgentVLN 利用相机模型,将这些三维可行路径点投影到当前摄像头视角下的二维图像中。最终,原本复杂的三维路径规划问题,被转换为:
“在图像中选择最符合语言指令的路径点。”
也就是说,模型不再需要直接从开放空间中预测一个精确坐标,而是将: 开放性的精细点坐标生成问题(open-ended coordinate generation) 转化为: 基于视觉提示的路径选择问题(choice-based selection) 。
这种方式充分发挥了 VLM 强大的视觉语义理解能力,同时避免其直接进行复杂三维几何推理。该机制通过将感知层计算得到的三维路径点投影到二维图像平面,生成像素级对齐的视觉提示,使 VLM 能够直接在视觉空间中选择符合指令的路径,并进一步恢复为三维导航控制信息。
上下文驱动的自我纠错机制
现实物理环境下,机器人可能遇到:“家具遮挡、光线变化;摄像头看不到目标;行进过程中产生误差。” 如果机器人一直按照原计划前进,小错误可能不断累积,最终导致完全偏离目标。
因此,AgentVLN 加入了上下文驱动的自我纠错机制。当机器人发现:当前路线不可见;或者环境和指令不匹配;它不会盲目前进,而是主动执行探索动作:转身观察; 调整方向; 搜索新的路径。
该机制能够在遮挡、盲区以及轨迹偏移情况下生成细粒度探索动作,从而减少长期导航中的误差累积。
主动调用感知技能补足空间信息
AgentVLN 提出 Query-Driven Perceptual Chain-of-Thought(QD-PCoT),让机器人具备 “主动获取信息” 的能力。其核心思想是:
当模型无法确定目标位置时,不再盲目预测,而是主动提出问题,并调用感知技能补充缺失信息。
当机器人无法判断椅子的距离时,会主动询问:
“前方椅子距离我有多远?”
随后调用深度感知模块获取空间信息,并结合反馈完成目标定位。相比直接回归目标坐标的方法,QD-PCoT 将导航过程转变为:
主动提问 → 获取信息 → 更新认知 → 决策行动
从而赋予机器人类似人类的 “自我认知” 能力,使其能够判断 “自己缺少什么信息”,并主动调用相应技能完成补充。论文实验表明,引入 QD-PCoT 后,AgentVLN 在无需增加额外参数的情况下进一步提升导航性能,有效缓解二维视觉中的深度歧义问题。
VLN 模型的端侧部署
很多先进视觉语言模型参数规模巨大,需要依赖云端服务器推理计算。AgentVLN 选择轻量化路线,采用 Qwen2.5-VL-3B 作为核心底座模型,并通过模块化设计避免额外的大规模三维视觉模块,实现了在 Jetson 边缘设备上的本地运行。