论文

不可靠的进度条:LLM 代理能否在整个执行过程中可靠地报告任务进度?

The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution?

模型评测模型能力评测

摘要

最近的 大语言模型 可以发出任务进度信号,代理框架使用这些信号来决定任务是否应该继续或停止,但模型是否能够在任务的每个阶段可靠地报告其任务进度,以及其报告在何处以及如何失败,尚未得到系统研究。我们在公共基准 $τ^2$-bench 和 StageIF 上评估这种能力,StageIF 是一个受控测试平台,在任务的整个生命周期中都放置了报告检查点。两种设置都需要多个任务阶段的报告。我们发现报告的可靠性取决于任务已达到的阶段,并且我们测试的几乎每个部署模型在某些阶段都是可靠的,而在其他阶段则不可靠。报告崩溃的地方并不相同。大多数部署的模型在工作开始后就会失去准确性,并在任务完成后恢复。最新一代的产品结束了中间任务的下降,而是在终点线变得保守。我们的研究揭示了任务进度报告中的能力差距,并提供了一个跨越任务执行整个过程的评估协议,以评估代理操作所依赖的这种能力。研究结果表明,代理框架不应仅根据模型的状态报告来控制任务流。