轰鸣的小跑SVM
26-09-08 08:00 微博认证:汽车达人 微博新知博主 汽车博主

#技术巡猎#小鹏汽车# 一个双足机器人往前走的时候,它其实看不见自己的脚。相机装在胸口或脑袋上,朝前朝下,视野里全是前方的路,脚一抬起来,腿正好把脚底那块地挡得严严实实。身后的路更不在视野里。它踩下去的每一步,严格说,都是记忆和猜测。

这是足式机器人感知里最要命的一块盲区。
小鹏这个“点云地图的预测方法”要解决的,就是看不见脚底这个问题。
行业原来怎么干的呢?主流方案是激光雷达,反射信号能拼出精度很高的三维地图,问题主要是贵+雨雪不好处理,复杂环境里照样是有死角的,便宜的玩法是纯视觉,用相机拍画面来分析地形,但机器人一旦走快了,画面出现了晃动,腿部遮挡噪声大了,脚底和身后基本就是感知不了的区域。

小鹏这份专利的思路是啥呢?让模型根据前几秒看到的东西加上机器人自己的动作,把看不见的部分算出来。

机器人身上装了深度传感器,就是能直接量出画面里每个点离镜头多远的相机。它可以按固定节奏拍深度图,专利的例子是每0.2秒一帧。另一条线是惯性里程计,记录关节位置速度角速度姿态。有个细节比较讲究,两条线采样频率不同,专利举的例子是深度图30赫兹状态信息100赫兹,机器人每秒走2米,时间戳根本对不齐。所以先做时间对齐,深度图采在100.5毫秒,就用100毫秒和101毫秒两个点插值算出那一刻的状态。

一帧图配一份状态,谁也别错位。

数据齐了以后就进模型,模型分三段干活。
第一段是擅长看图的卷积网络,从每帧深度图里提取环境特征,台阶边缘,高度落差,地形起伏。第二段是多层感知机,处理数字序列的神经网络,从状态信息里提取行为特征,在抬腿还是落地,身子晃没晃。两路分开提取,互不干扰。

第三段才是关键,一个带记忆的时序网络,专利给了两个候选,门控递归单元网络或者长短期记忆网络。它把过去的环境特征和行为特征按时间串起来,一边读一边记,用门控机制过滤腿部遮挡和噪声,留下真正的地形变化规律。

取结果也是有讲究的。时序网络每读一帧吐出一个状态,读10帧就有10个,第10个隐式装着前9帧的全部信息。专利只取最后一个,其余丢掉,信息是完整的,计算量也不至于膨胀。最后再交给解码器,把这个压缩状态还原成高度图。高度图是啥呢,你把机器人周围地面划成小格子,专利的分辨率是0.1米乘0.1米,每个格子存一个高度值,凸起凹陷台阶都在里面。它以机器人当前位置为圆心往外扩,脚底和身后这些拍不到的区域也在里面。

模型怎么学会的,专利也写了。在仿真环境里让机器人跑各种越障动作,同步记录状态深度图和真实地形,或者用高精度激光雷达扫出地形当真值,预测结果跟真值比对,误差大就调参数,一直调到能稳定补全被遮挡的区域。要注意的是这份专利的措辞,它通篇说的不是车,是移动装置---可以是双足四足轮式机器人,也可以是车辆无人机飞机船舶。当然它反复提腿部遮挡和脚底盲区,主要还是冲着足式机器人去的。

从车轮高度搬到脚踝高度,把机器人自己的动作塞进模型。
背景摆在这的,大师兄说过,机器人和智能汽车在感知规划软件层面有七成技术重合。
这份专利就是那七成里的一块。

发布于 广东