论文
具有用户反馈的交互式情景记忆
Interactive Episodic Memory with User Feedback
摘要
在具有自然语言查询(EM-NLQ)的情景记忆中,用户可能会问一个问题(例如,“我把杯子放在哪里?”),这需要搜索从用户的角度捕获的以自我为中心的长视频,以找到回答该问题的时刻。但是,查询可能不明确或不完整,从而导致错误的响应。当前的方法忽略了这一关键方面,并在一次性设置中解决 EM-NLQ,限制了它们在现实场景中的适用性。在这项工作中,我们解决了这一差距并引入了带有问题和反馈的情景记忆任务(EM-QnF)。在这里,用户可以提供有关模型初始预测的反馈或添加更多信息(例如,“在此之前。我正在寻找蓝色大杯子而不是白色杯子”),帮助模型以交互方式完善其预测。为此,我们收集基于反馈的交互数据集,并提出一种轻量级训练方案,避免昂贵的顺序优化。我们还推出了即插即用的反馈对齐模块 (FALM),使现有的 EM-NLQ 模型能够有效地纳入用户反馈。我们的方法在三个具有挑战性的基准上显着改进了现有技术,并且优于商业大型视觉语言模型或具有竞争力,同时保持高效。对人类生成的反馈进行的评估表明,它可以很好地推广到现实世界的场景。