论文

On the Clock:Agent守时与有效使用时间预算是两项能力

On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents

智能体系统模型训练强化学习Agent HarnessAgent任务评测

摘要

我们研究小型LLM Agent能否在明确的实际运行时间预算下有效工作,既遵守分配的运行时间,又有效利用可用时间。我们在MLE-Bench Lite的五项竞赛中评测Qwen3.6-27B,并在Zork I(Jericho)上评测Qwen3-4B;这两类Agentic基准中的额外计算时间都可能改善表现。在最简单的设置中,仅在提示词内声明预算,Agent无法将预算转化为可控的时间使用。这些失败来自时间感知不足:Harness没有提供计时反馈;同时Agent不能可靠预测动作时长,也没有学到从可用时间到适当策略的映射。我们研究两类互补干预:通过Harness暴露计时信息并执行截止时间,以及使用预算感知奖励的强化学习。通过Harness注入计时信息显著改善Qwen3.6-27B的预算遵守,且未测得性能损失;执行Hook进一步提高遵守程度。GRPO强化学习在Zork I上达到近乎完全遵守预算,并泛化到训练中未见的留出预算,但在MLE-Bench上并未优于未经训练的Harness。当Agent能够遵守预算后,仍不能利用更多时间改善任务表现。强化学习策略学会何时停止,却经常用重复动作填充额外时间;在多个预算上训练GRPO往往收敛到最短预算对应的策略。结果揭示了遵守时间与有效分配时间之间的差距,这仍是预算条件Agent的核心挑战。