论文

无需训练,飞行更佳:用于无人机导航的测试时间缩放 VLM

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

模型推理推理搜索与路径规划

摘要

测试时间扩展提供了一种很有前景的方法,无需额外训练即可提高视觉语言模型 (VLM) 的推理性能。无人机 (UAV) 的现有视觉语言导航 (VLN) 方法通常依赖于单个推理过程,该推理过程可能会在复杂环境中产生次优或不安全的轨迹,从而出现问题。在本文中,我们探索了一种简单有效的方法,将测试时间缩放应用于无人机的 VLN。我们通过迭代细化过程增强导航推理,无需额外的 模型训练,引导模型重新评估其初始导航计划,以获得更好的准确性和安全性。我们的方法首先提示模型生成多个并行候选,然后执行自我校正步骤,在不更改底层模型的情况下实现更深入、更稳健的规划。为了进一步加强决策,我们设计了一个多标准评分函数,根据安全性、目标一致性和前进进度来评估细化的候选者。这种简单而强大的组合使冻结的无人机导航 VLM 能够自我纠正并生成更准确、更可靠的飞行计划,从而在此任务中实现 SOTA 性能。