爱可可-爱生活
25-12-29 05:44 微博认证:AI博主 2025微博新锐新知博主

[RO]《LoGoPlanner: Localization Grounded Navigation Policy with Metric-aware Visual Geometry》J Peng, W Cai, Y Yang, T Wang... [Tsinghua University & Shanghai AI laboratory] (2025)

具身智能导航的新突破:LoGoPlanner 实现端到端定位与规划的深度融合

在非结构化环境中,如何让移动机器人像人类一样,仅凭视觉就能流畅、安全地抵达目的地?这是机器人学中一个基础且极具挑战的课题。

传统的导航方案通常像是一场“传声筒”游戏:感知、定位、建图、规划,每个模块环环相扣。然而,这种模块化架构在现实部署中往往面临严重的延迟和误差累积。一旦定位模块在剧烈运动中产生漂移,下游的规划就会瞬间崩溃。

本文提出的 LoGoPlanner,为这一难题提供了全新的解法。它不仅是一个端到端的导航模型,更是一个“自带定位感”的智能体。

核心突破:从显式依赖到隐式植根

目前的端到端导航方法虽然简化了流程,但大多仍需依赖外部的定位模块(如 SLAM 或视觉里程计)来更新自身状态。这不仅要求相机与底盘之间有极其精确的外参标定,还限制了算法在不同形态机器人上的通用性。

LoGoPlanner 的核心逻辑在于“定位植根”(Localization Grounded)。它通过以下三大支柱,打破了传统框架的束缚:

1. 具有度量感知的视觉几何:
模型微调了一个长时视觉几何主干网络(VGGT),并注入了深度先验。这意味着机器人看到的不再是缺乏比例尺的图像,而是具有绝对物理尺度(Metric Scale)的 3D 场景。这种对物理空间的精准量化,是实现可靠避障的前提。

2. 隐式状态估计:
LoGoPlanner 不再依赖外部定位信号,而是通过处理长时视觉序列,在特征层面隐式地估计机器人的运动状态。这种设计巧妙地解耦了相机感知与底盘控制:感知随镜头而动,控制随底盘而行。即便相机安装高度或倾角发生变化,机器人依然能保持稳定的行动能力。

3. 基于查询的扩散策略:
受领先的自动驾驶框架启发,模型采用基于 Query 的设计,将隐式状态、环境几何和目标点特征融合进统一的规划语境中。随后,利用扩散策略(Diffusion Policy)迭代生成无碰撞的轨迹。这种方式避免了将预测的位姿或点云直接传递给下游可能导致的误差放大。

实验表现:超越“真值定位”的鲁棒性

在仿真实验中,LoGoPlanner 的表现令人惊叹:在没有外部定位辅助的情况下,其成功率比那些拥有“上帝视角”(真值定位)的基准模型还要高出 27.3%。这证明了将定位与规划深度耦合,比简单的模块组合更具韧性。

在真实世界中,LoGoPlanner 展示了极强的跨平台适配能力。无论是轮式机器人 TurtleBot,还是四足机器人 Unitree Go2,甚至是人形机器人 Unitree G1,在办公室、杂乱的居家环境或工业场景下,它都能直接部署并稳定运行。即便四足机器人行走时的相机抖动,也无法干扰其对空间的精准判断。

深度思考:导航的本质是几何与意图的对齐

LoGoPlanner 的成功带给我们一个深刻的启示:感知是相机的视角,而控制是底盘的意志。优秀的导航算法不应只是简单地堆叠传感器数据,而应在特征空间内完成几何重建与行动意图的深度对齐。

当机器人能够“理解”空间的物理尺度,并能从视觉历史中“感知”自己的位移时,它就不再是一个被动接受指令的机器,而是一个能够自我修正、适应万物的智能体。

这种“定位植根”的思路,正引领具身智能从实验室走向更广阔、更复杂的真实世界。

原文链接:arxiv.org/abs/2512.19629

发布于 北京