论文

评估使用工具的语言代理:在 AgentProp-Bench 中判断可靠性、传播级联和运行时缓解

Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench

智能体系统Agent HarnessAgent任务评测

摘要

人们普遍认为使用大语言模型(LLM)代理的工具自动评估是可靠的,但这种假设很少经过人工注释的验证。我们推出了 AgentProp-Bench,这是一个包含 2,000 个任务的基准测试,具有跨四个领域的 2,300 个跟踪、九个生产 LLM 和一个 100 个标签的人工验证子集。我们量化判断的可靠性,描述错误传播的特征,并评估运行时的缓解措施。基于子串的判断与人工注释一致,kappa=0.049(机会级别);三个 LLM 整体达到 kappa=0.432(中等),带有保守偏差。在经过验证的评估下,参数级注入会传播到错误的最终答案,人工校准的概率约为 0.62(模型范围为 0.46-0.73)。拒绝(捕获不良参数)和恢复(接受后纠正)是独立的模型功能(Spearman rho=0.126,p=0.747)。在并发 n=600 控制下,经过调整的运行时拦截器将 GPT-4o-mini 上的幻觉减少了 23.0 个百分点,但对 Gemini-2.0-Flash 没有显着影响,其积极的参数拒绝消除了目标故障模式。所有代码、数据、痕迹和人工标签均在 https://github.com/bhaskargurram-ai/agenthallu-bench 发布。

评估使用工具的语言代理:在 AgentProp-Bench 中判断可靠性、传播级联和运行时缓解
图 1:P2 语义错误注入下每个模型的阶段到达率(整体判断,n = 1,350 n{=}1{,}350)。 S 1 S_{1} : 注入; S 2 S_{2} :可见的执行效果; S 3 S_{3} :最终答案错误。阶段指标是独立计算的。