论文
视觉和语言导航中自我改进代理的平衡本质
The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation
摘要
在视觉和语言导航(VLN)中,仅使用标准的 VLN 动作监督,从策略诱导的经验中进行自我改进,关键取决于平衡行为多样性和学习稳定性,这决定了代理是否可以提取可靠的学习信号以进行改进。增加行为多样性对于揭示替代行动假设是必要的,但可能会破坏政策引发的学习信号的稳定性,而过于保守的稳定性约束会抑制探索并诱导早期承诺,从而使可靠的自我完善变得困难。为了应对这一挑战,我们提出了稳定性-多样性平衡(SDB),这是一种在 VLN 中平衡自我改进的即插即用机制。 SDB 通过在指令条件隐藏状态中应用受控移位,将每个决策步骤扩展为多个潜在行为假设,然后执行可靠性感知软评估和聚合,以在学习过程中保留多样化但指令一致的替代方案。显式正则化器进一步限制假设相互作用,防止假设多样性的过度漂移或过早崩溃,并在不丢弃训练信号的情况下稳定自我改进。 R2R、SOON 和 REVERIE 上的实验显示出一致的改进;例如,在 REVERIE val-unseen 上,SDB 将 SPL 从 33.73 提高到 35.93,将 OSR 从 51.07 提高到 54.25。