论文
VISTA:通过主动多模态Agent的策略蒸馏内化集体视觉体验
VISTA: Internalizing Collective Visual Experience via On-Policy Distillation for Active Multimodal Agents
摘要
主动多模态Agent在推理时使用视觉工具来获取与任务相关的证据。尽管强化学习对每个输入的多个交互轨迹进行采样,但基于结果的目标主要使用群体来估计标量优势,从而导致互补的视觉发现未得到充分利用。我们引入了 VISTA,它通过将相同输入的观察转化为共享监督,通过策略蒸馏将集体视觉体验内化。集体视觉体验蒸馏(CVED)将这些观察结果与其交互环境进行组织,并将其与个人决策保持一致,而异质性感知策略改进(HAPI)则强化了成功的轨迹,并为不成功的尝试提供了经验引导的蒸馏。经验丰富的教师评估学生的采样响应前缀,允许从一个轨迹的发现指导另一个轨迹的学习,而无需替换学生的原始历史或生成新的目标轨迹。经过训练的Agent保留其视觉工具并使用其自己的交互历史记录进行操作。在所评估的同等大小的主动多模态智能体中,VISTA 实现了最强的平均性能,并且在细粒度感知和一般推理任务中始终优于同骨训练基线,这证明了集体经验对于主动多模态学习的价值。