论文
实时截止日期揭示了大语言模型战略对话中的时间意识失败
Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues
摘要
大语言模型 (LLM) 在离散时间内逐个生成文本,但现实世界的通信(从治疗会议到商务谈判)严重依赖于连续的时间限制。当前的大语言模型架构和评估协议很少测试实时截止日期下的时间意识。我们在严格的期限内使用配对代理人之间的模拟谈判来研究大语言模型如何在时间敏感的环境中调整他们的行为。在控制条件下,智能体只知道全局时间限制。在时间感知条件下,它们每次都会收到剩余时间更新。在时间感知条件下,交易完成率要高得多(GPT-5.1 为 32% vs. 4%),报价接受率比对照组高六倍,这表明大语言模型很难在内部跟踪经过的时间。然而,同样的大语言模型在回合制限制下实现了近乎完美的交易完成率($\geq$95\%),这表明失败在于时间跟踪而不是战略推理。这些影响在谈判场景和模型中复制,说明LLM时间意识的系统性缺乏将限制LLM在许多时间敏感应用程序中的部署。
