论文
推动您的代理:衡量和执行长期代理的定量目标持久性 LLM 代理
Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents
摘要
长视野语言代理可以进行许多看似合理的本地工具调用,但在请求的计数实际完成之前无法持续。我们将这种差距研究为定量目标持久性(QGP):代理是否继续工作,直到外部验证者确认足够多的不同有效项目。 PushBench 将其转变为存储库工件收集和验证者支持的工作单元的基准,因此重复工作、重复提交、错误完成和进度漂移都是直接测量的,而不是隐藏在最终成功标志后面。在匹配的控制器比较中,状态跟踪检索控制器在消除重复提交的同时达到了 69-78% 的成功率,而积压跟踪工作单元控制器在标准和完成门控控制器不完成任务实例的设置中达到了 25-50% 的成功率。使用 Claude Code (Sonnet 4.6) 和 Codex CLI (gpt-5.4) 进行的黑盒前沿代理评估解决了许多 50 个工件的任务,但在 100 个工件的情况下,每种条件的 9 次成功率下降到 3 次。结果表明,定量目标强调与本地任务能力不同的可靠性要求:代理必须保持经过验证的进度,并且仅在请求的工作完成时才停止。