论文
MIRAGE:对话状态如何影响多模式个人代理中的历史证据使用
MIRAGE: How Conversation State Shapes Historical Evidence Use in Multimodal Personal Agents
摘要
多模式大语言模型 (MLLM) 代理越来越多地用作长期运行任务的个人助理。它们的实用性取决于连续性:代理必须检索并使用对话、文件和工作空间状态中的早期证据。然而,即使历史记录的获取能力下降,代理人也可以生成看似合理的答案,从而导致仅结果评估高估了真实证据的使用。我们提出了 MIRAGE(多模态交互检索、归因和基础评估),这是一项针对多模态个人代理对话状态变化下历史证据使用的对照研究。 MIRAGE 固定证据对象、问题和评分,同时仅改变对话状态,并评估代理是否可以确定可回答性、恢复正确的来源并从中回答。在七个前沿和开放权重多模式主干中,我们发现:1)预压实深度和压实后延续形成不同的、非单调的破坏机制,而不是单一的退化曲线; 2)开放权重模型严重依赖上下文连续性,并且在来源失败时不愿意自发切换到工具介导的检索; 3)检索压力改善了工具兼容模型的深度预压缩状态下的源归因,但在压缩后持续回归,其中存储的证据已经退化。这些发现表明,历史证据的使用应该在状态变化的情况下进行评估,而不是从仅结果的正确性中推断出来。