论文
故障透明Agent:工具使用语言模型中故障后报告的基准测试
Failure-Transparent Agents: Benchmarking Post-Failure Reporting in Tool-Using Language Models
摘要
使用工具的Agent可能会失败两次:所需的工具可能会失败,然后Agent可以在没有必要的证据来证明其成功的情况下报告成功。现有的基准测试经常将这种报告失败与工具选择、恢复和环境动态纠缠在一起。我们引入了故障透明Agent(FTA),这是一种受控基准,可以在生成之前修复失败的观察和所需的证据状态,从而使故障后的索赔可以直接审核。 FTA 包含 100 个任务,具有跨越五个故障系列的确定性故障跟踪、一个中立控制和四个用户压力条件,并评估不支持的声明以及有用的恢复。在六种模型、三种响应策略和 3,600 个人工注释的响应中,基准策略下的错误成功率为 22.8%,透明度指令为 9.3%,结构化证据合约为 0.8%。捏造细节的比率从 28.3% 下降到 14.3% 和 0.8%,而有用的回复则从 74.9% 分别增加到 89.2% 和 98.8%。经过测试的证据契约策略与显着降低的故障后报告错误相关,而在此阻塞任务基准中有用响应率仍然很高。