论文

实时截止日期揭示了大语言模型战略对话中的时间意识失败

Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 在离散时间内逐个生成文本,但现实世界的通信(从治疗会议到商务谈判)严重依赖于连续的时间限制。当前的大语言模型架构和评估协议很少测试实时截止日期下的时间意识。我们在严格的期限内使用配对代理人之间的模拟谈判来研究大语言模型如何在时间敏感的环境中调整他们的行为。在控制条件下,智能体只知道全局时间限制。在时间感知条件下,它们每次都会收到剩余时间更新。在时间感知条件下,交易完成率要高得多(GPT-5.1 为 32% vs. 4%),报价接受率比对照组高六倍,这表明大语言模型很难在内部跟踪经过的时间。然而,同样的大语言模型在回合制限制下实现了近乎完美的交易完成率($\geq$95\%),这表明失败在于时间跟踪而不是战略推理。这些影响在谈判场景和模型中复制,说明LLM时间意识的系统性缺乏将限制LLM在许多时间敏感应用程序中的部署。

实时截止时间揭示LLM策略对话中脆弱的时间适应
图A.2:不含延迟因子时不同处理条件与时间限制下的成交达成情况。在去除每分钟 150 词的延迟调整后,GPT-5.1-chat-latest 智能体在各实验条件和时间约束下的成交达成率。每根柱表示谈判达成成功协议的比例(每个条件 N=100)。Time Aware 条件下,智能体在每一轮都收到明确的时间反馈,在短和中等时间限制下显示出更高的达成率。在更高的时间限制下,两种条件都接近天花板性能。误差线表示 95% Wilson 置信区间。结果表明,时间感知效应并非每分钟词数计时假设造成的假象。