论文

哪个地形更好?使用 VLM 原型进行偏好学习,进行越野可通行性排名

Which Terrain Is Better? Preference Learning with VLM Prototypes for Off-Road Traversability Ranking

模型训练奖励建模与过程监督

摘要

在基于视觉的越野导航中,机器人不仅需要知道要避开哪些障碍物,还需要知道哪些地形更好。第一个是通过自由空间检测或语义分割来处理的。第二个通常用可遍历性分数来回答,但这样的分数不存在通用的基本事实,因此感知会依赖于每个语义类的预定义值或自由空间置信度。这些分数说明了一个区域是什么,而不是机器人应该更喜欢哪个区域。因此,我们将这种偏好表述为视觉可穿越性排名,即可以通过两个区域之间的比较来监督的可见地形的排序。标准注释不标记偏好,但暗示其方向。我们提出了 TravPro,它将这些注释转换为有序区域对,并将冻结视觉语言模型 (VLM) 补丁标记上的小读数拟合到这些对。词元一次聚集到固定的原型库中,并且读出器学习每个原型的偏好分数。然后将读数应用于每个补丁,并充当老师,将稀疏比较转换为密集偏好伪标签,而无需逐像素注释。 RGB 学生将这些地图提炼成密集的地形偏好地图以及从排名中排除障碍物和背景的非地面掩模。在五个看不见的域上,TravPro 的平均成对精度达到 0.915,而最强基线为 0.783,产生对表面条件敏感的排序,而每类值无法表示。当提示 VLM 并将监督用作密集目标时,相同的 VLM 和相同的监督不会产生这样的排序;重要的是如何使用它们。