论文
AgentTime:Agent能否估计并控制自己的运行时间?
AgentTime: Can Agents Estimate and Control Their Own Runtime?
摘要
管理运行时间是AI Agent的重要控制能力,需要具备时间意识,能够预测和估计实际耗时,并控制自身行动。已有工作主要研究时间意识,而原生Agent Harness中的指定时长执行与控制仍缺少研究。我们提出AgentTime,测试Agent能否按要求持续工作、预测任务耗时,以及在事后估计已经过去的时间。该基准包含来自18个来源的222项任务,涵盖编程、计算机操作、Agentic工作和自动化研究。指定时长实验仅增加一条工作时长要求,范围从约一分钟到数天。不同系统遵循要求的能力差异显著:Claude Code中的Fable 5.1与要求时长的典型偏差为2.9倍,Codex中的GPT-6 Astra为1.2倍。然而,耗时匹配并不证明Agent持续开展有效工作。在158次记录可分类的Astra运行中,14次在任务看似已经完成后显式执行了等待。耗时预测通常高估自然完成时间。事后估计实验中,移除时间信息会使Sol和Astra的偏差增加超过一倍,Fable的偏差也接近增加一倍。Agent能够完成任务,不代表它能控制自己的时间,或在整个指定时段内持续工作。要让Agent在长程任务中可靠、安全、自主运行,需要同时评测任务完成与时间控制能力。
