论文

HiRO-Nav:混合推理实现高效具身导航

HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation

模型推理测试时计算扩展

摘要

基于大型推理模型(Large Reasoning Model, LRM)构建的具身导航智能体能够处理复杂的多模态环境输入,并在每一步执行有据可依的推理,以改进长程任务的序贯决策。然而,一个关键问题仍然存在:如何智能且高效地将LRM的推理能力用于长程导航任务?在简单场景中,智能体应作出反射式动作;而在复杂场景中,则应在行动前进行审慎推理。为实现这一点,我们提出混合推理导航(Hybrid ReasOning Navigation, HiRO-Nav)智能体,这是首个能够基于自身动作熵在每一步自适应决定是否进行思考的智能体。具体而言,通过考察智能体的动作熵在导航轨迹上的演化,我们观察到只有一小部分动作呈现高熵,而这些动作往往引导智能体驶向新异场景或关键物体。此外,对动作熵与任务完成度(即Q值)之间关系的研究表明,改进高熵动作对任务成功的贡献更大。因此,我们提出一套定制的训练流程:以混合监督微调作为冷启动,随后采用所提出的混合推理策略进行在线强化学习,仅对高熵动作显式激活推理,从而在提升决策质量的同时显著降低计算开销。在CHORES-S ObjectNav基准上的大量实验表明,与密集思考和零思考两类基线相比,HiRO-Nav在成功率与token效率之间取得了更好的权衡。

HiRO-Nav:混合推理实现高效具身导航:论文配图
图 1:HiRO-Nav 智能体根据自身的动作熵 Hπθ​(at,𝒙t)H_{\pi_{\theta}}(a_{t},\bm{x}_{t}) 自适应地确定是否进行思考的图示。根据我们的观察,高熵动作通常会引导智能体走向新场景或关键物体,这些场景或关键物体位于导航轨迹上的关键航点上,即鸟瞰图中的黑色虚线。因此,HiRO-Nav 仅针对这些高熵动作(红点)激活推理,与密集思维和无思维智能体相比,改善了推理效率和性能之间的权衡,如图 4 所示。