论文
你忘了我问什么了吗? 大语言模型 中的预期内存故障
Did You Forget What I Asked? Prospective Memory Failures in Large Language Models
摘要
当 大语言模型 必须同时执行要求较高的任务时,它们通常无法满足格式化指令。我们通过认知心理学的前瞻性记忆启发镜头来研究这种行为,使用一种受控范式,将可验证的格式约束与日益复杂的基准任务结合起来。在三个模型系列和 8,000 多个提示中,并发任务负载下合规性下降了 2-21%。漏洞高度依赖于类型:终端约束(需要在响应边界采取行动)降级最多,下降幅度高达 50%,而回避约束仍然相对稳健。显着性增强格式(显式指令框架加上尾随提醒)可以恢复大部分失去的合规性,在许多设置中将性能恢复到 90-100%。干扰是双向的:格式限制也会降低任务准确性,一种型号的 GSM8K 准确性从 93% 下降到 27%。在额外的堆叠实验中,随着约束的积累,联合柔顺性急剧下降。所有结果均使用确定性编程检查器,而无需在公开数据集上使用 LLM 作为判断组件。