论文

SSCBench:评估使用工具的 LLM 代理的故障注入测试的证据有效性

SSCBench: Evaluating the Evidential Validity of Fault-Injection Tests for Tool-Using LLM Agents

模型评测基准与评测资源评测方法与指标鲁棒性、公平性与可信度评测

摘要

故障注入越来越多地用于评估使用工具的 LLM 代理的可靠性。然而,当代理本身确定哪些权威观察在执行过程中变得可见时,如何解释错误采用结果的研究还很有限。在本文中,我们对代理故障注入评估中的证据有效性问题进行了系统研究。我们开发了一个测量协议,指定哪些观察可以反驳注入的断言,确定它们是否可以在首次使用受影响的事实之前变得可见,并记录评估的执行是否真正实现了这种条件。我们将 SSCBench 构建为协议的实例,并在两个 $τ$ 基准环境中对 1,191 次错误执行中的四个错误运算符和五个代理配置进行评估。我们的实验表明,承认的故障案例和代理配置可以在执行过程中实现显着不同的证据条件,并且即使在支持群体的情况下,总体采用也可以保持良好的定义。 及时反证主张很少或不存在。例如,在 44 次采用的反证据最终变得可见的运行中,只有 17 次在首次使用之前收到,而 27 次在之后收到。我们还发现,首次错误时机和后来的立场修正不需要一致,并且自动轨迹分析可以恢复采用,而无需可靠地恢复时间诊断所需的第一个错误依赖事件。我们认为,执行所实现的证据条件和支持特定权利要求解释的群体是错误注入评估本身的一部分,并且应该在使用前反证下被解释为失败之前进行报告。