论文

AgentNoiseBench:噪声条件下工具使用型LLM Agent的鲁棒性基准测试

AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition

智能体系统Agent任务评测

摘要

大语言模型(LLM)的最新进展使基于LLM的Agent在各种基准测试上取得了强劲表现。然而,它们在真实世界部署中的表现往往落后于基准测试设置下所观察到的水平,在复杂且不完善的环境中尤其如此。这一差距很大程度上源于:主流的训练与评估范式通常建立在理想化假设之上,忽视了真实世界交互中固有的随机性与噪声。为弥合这一差距,我们提出AgentNoiseBench,一个用于系统性评估agentic模型在噪声环境下鲁棒性的框架。我们首先深入分析了真实世界场景中的偏差与不确定性,并将环境噪声归为两大主要类型:用户噪声(user-noise)与工具噪声(tool-noise)。基于这一分析,我们开发了一条自动化流水线,在保持任务可解性的前提下向现有以Agent为中心的基准注入可控噪声。利用该流水线,我们对架构与参数规模各异的广泛模型开展了大规模评估。我们的结果揭示了不同噪声条件下一致出现的性能波动,凸显了当前agentic模型对现实环境扰动的敏感性。

AgentNoiseBench:噪声条件下工具使用型LLM Agent的鲁棒性基准测试
图1:AgentNoiseBench 上的总分,按模型在噪声条件下的性能排序。