论文

用于问题引导主动视觉的免渲染前瞻

Rendering-Free Lookahead for Question-Guided Active Vision

摘要

主动机器人视觉需要控制相机来显示从当前视点隐藏的任务相关信息。例如,确定盒子里面有什么可能需要抬起相机并向下看。对于依赖于视点的问答,挑战在于选择能够暴露回答问题所需的视觉证据的摄像机运动。尽管视觉语言模型 (VLM) 可以解释观察到的图像,但选择此类运动需要预测未见过的视图的有用性。我们将这种有用性量化为可回答性,即 VLM 对视图足以回答问题的估计,并提出了无渲染前瞻 (RFL),这是一种视点选择策略,通过预测未来的可回答性对候选摄像机运动进行排名。 RFL 将视觉前瞻从部署转移到离线训练。在训练中,一位享有特权的教师会在 3D 高斯分布 (3DGS) 场景中渲染候选者的未来视图,并使用冻结的 VLM 来计算一步和两步的可回答性目标。通过两阶段蒸馏,学生学会预测这些 来自问题的动作值、最近的视觉观察和候选相机运动。在部署时,RFL 使用这些预测值来选择相机运动,而无需渲染未来视图。在未见过的环境中进行的 377 个 E3VS-Bench 测试中,与使用相同 VLM 的直接操作基线相比,RFL 将平均判断分数提高了 43%。这些结果支持从特权视觉前瞻中学习相机控制策略,以实现依赖于视点的问题回答。