论文

任务状态应在多大程度上影响 LLM Agent?

How Strongly Should Task State Influence an LLM Agent?

智能体系统Agent任务评测

摘要

长程委派任务要求 LLM Agent 跟踪任务状态:哪些步骤已完成、被阻塞、被取消或可重做。Agent 系统要么把状态作为文本放在提示中、依赖模型去读,要么把状态移入一个强制执行它的模块;而每个系统都作为整体被评测,因此没人知道可靠性有多少来自状态被展示、被告知还是被强制执行。我们固定任务规则、模型与配对回合,改变任务状态到达 Agent 的强度:原始转录、精确清单、由任务简报编译并仅凭执行回执推进的状态机给出的逐回合指令,或在该状态机上加装拒绝违反状态动作的强制门;每个回合都用针对动态真值的精确载荷匹配打分。跨三个模型、两种推理模式与两个领域,在无逐回合推理时有四个发现成立:展示准确状态并不可靠;Agent 自己写下的未验证台账胜过展示给它的准确清单;指令的收益与模型的服从度成正比;强制执行不需要服从,但受其状态正确性以及把请求映射到步骤的匹配器所限制。235B Agent 的逐回合推理压缩了这些差距,却没有修复文本档位。由 τ²-bench 航空政策编译的同一道门,把 235B Agent 的 pass^1 从 0.39 提到 0.54,而对很少违反政策的 35B Agent 毫无改变;在 PM-Bench 上——行动取决于识别线索而非状态——展示记录是最好的档位,匹配或超过两道门并反转了台账胜过清单的结论,而强制执行匹配器的判断会把 35B Agent 拉到低于其原始转录的水平。当失败是状态可判定且频繁时,强制执行有回报;当门的判断错误时,它带来伤害。