论文

当历史帮助和伤害时:跨多模式转弯的选择性历史使用

When History Helps and Hurts: Selective History Use across Multimodal Turns

模型评测基准与评测资源模型能力评测

摘要

可靠的多模式交互取决于对话历史的选择性使用:较早的问题可能仍然相关,而其先前的答案已经过时,而当前的请求可能取决于历史证据,尽管新的观察结果相互矛盾。现有的多轮评估很少将这些历史使用需求与潜在的问题难度分开。为了解决这一差距,我们引入了 ReTurn,这是一个包含 7,000 个基本任务的基准,涵盖视觉和音频证据,用于评估选择性历史记录的使用。对于承载历史的任务,Reconfirm/Reground要求将历史问题应用于当前媒体,同时改变历史协议;对于有证据的历史,检索/重新绑定需要使用历史媒体回答当前问题,同时改变当前媒体竞争。每对都保留目标问题、媒体和答案。任务支持开放式和多项选择评估,并以匹配的单轮对应项作为可回答性参考。跨越 13 个全模态、视觉语言和音频语言模型,中值模型级别开放式 准确率从直接输入的 93.7% 下降到对话中的 72.3%。行为探索表明,高问题回忆可以与较弱的任务应用共存,而竞争性媒体可以将答案从历史目标中重定向出来。有监督的适应只能产生部分收益。 ReTurn 提供了一个受控框架,用于评估多模式模型是否选择和使用每个请求所需的历史信息。