论文
学习从估计的听众注视中进行参考
Learning to Refer from Estimated Listener Gaze
摘要
我们建议微调视觉语言模型,通过将以注视扫描路径的形式对增量听众理解的观察转化为学习信号,生成更实用的最佳指代表达。在训练期间,指代表达是从正在优化的说话者策略中采样的,以图像和目标指代为条件;然后,估计人类凝视行为的神经监听器将图像和采样的指称表达映射到扫描路径,每个路径都由一系列注视表示,每个注视对应于指称表达中的一个单词。我们尝试了几种将注视序列和目标参照物转换为词元和序列级奖励的方法,这些奖励用于优化策略参数。通过对人类听众的评估,我们发现用注视估计听众训练的说话者策略比基本模型产生了更实用的最佳参考,将序列长度从 15.4 个单词减少到 4.0 个单词,同时将参考成功率从 75.2% 提高到 80.0%。我们的工作展示了通过基于语言的交互来学习生成话语的一个有前途的机会,不仅来自于沟通成功的明确信号,还来自于对听众理解过程的隐式观察。