论文

专注于任务:测试长期Agent可靠性的基础

Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability

智能体系统Agent任务评测长程任务评测

摘要

长期 Agentic 工作流程要求模型在上下文增长、子任务复杂性变化和新数据到达时维持重复的状态相关操作。每种情况都代表一个独立的轴,Agent可能会沿着该轴失败。例如,协调长账本的Agent必须重复读取其状态,更新正确的记录,并保持数千个输出的对齐。模型可能会接受整个账本,但会失去其位置或随着生成的进行而停止应用操作。我们引入了 Long-Transduction,这是一种受控诊断,可测试模型在长时间生成过程中保持任务的能力,同时连续读取、变异和输出依赖于输入上下文的操作(例如算术、排序、变量查找和表转换)。长转换评估独立地改变局部任务复杂性、输入数据格式和上下文长度,隔离沿每个轴的故障。我们评估了七个开放权重模型,发现当上下文长度从 4-128K 扩展时减少了 62.8%,当改变输入格式时减少了 36.5%,通过增加本地任务复杂性减少了 39.9%。总之,这些失败代表了长期 Agentic 工作流程中的关键责任。