论文
LLM能感知时间吗?实证研究
Can LLMs Perceive Time? An Empirical Investigation
摘要
大语言模型 无法估计自己的任务需要多长时间。我们通过 68 个任务和四个模型系列的四项实验来研究这一限制。任务前估计超出实际持续时间 4--7$\times$ ($p < 0.001$),模型预测任务在几秒钟内完成的人类规模分钟数。相对排序的情况也好不到哪儿去:在旨在暴露启发式依赖的任务对上,模型得分等于或低于机会(GPT-5:反直觉对上的 18%,$p = 0.033$),当复杂性标签误导时,系统会失败。事后回忆与现实脱节——估计值与实际值在任一方向上都存在一个数量级的偏差。这些故障在多步骤代理设置中持续存在,错误为 5--10$\times$。这些模型拥有有关训练持续时间的命题知识,但缺乏自己的推理时间的经验基础,对智能体调度、规划和时间关键场景具有实际意义。