论文
TriggerBench:研究 大语言模型 的预期内存
TriggerBench: Investigating Prospective Memory for Large Language Models
摘要
虽然 大语言模型 (LLM) 越来越多地部署在长时间交互中,但现有的评估主要集中在通过显式查询的回顾性记忆 (RM) 上。预期记忆(PM)是一种在没有直接提示的情况下自发回忆并根据潜在约束采取行动的关键能力,但在很大程度上仍然没有得到评估。我们推出 TriggerBench,这是一个全面的 PM 基准测试,涵盖日常助理和专业工作流程的五个维度。 TriggerBench 将场景与匹配的 RM 控制、对比正/负变体和过载触发器配对,从而能够在单个协议下对主动回忆、误报率和注意力鲁棒性进行细粒度测量。我们的评估得出了三个主要发现。 (i) PM 显示出精确回忆权衡和注意力脆弱性。尽管增强推理显着提高了主动回忆,但模型可能会过度适应“始终提醒”启发式。此外,在隐式约束或并发用户请求过载的触发器下,PM 准确性会大幅下降,这表明稳健的 PM 仍然是一个开放的挑战。 (ii) PM 明显比 RM 更难:在相同的上下文中,RM 接近饱和直至 100K 个词元,而 PM 随着上下文长度的扩展而急剧衰减。 (iii) PM 可以作为备用推理能力的行为探针。将 PM 场景与 AIME-2025 数学问题配对表明,在相同的上下文长度下,成功的轨迹比失败的轨迹产生更高的 PM 准确性,这表明 PM 跟踪词元计数掩盖的备用推理预算。项目页面:https://github.com/KristenZHANG/TriggerBench-Official。