论文

ReliabilityBench:在类生产压力条件下评估LLM Agent可靠性

ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

智能体系统Agent任务评测

摘要

现有的工具使用型LLM Agent基准主要报告单次运行成功率,遗漏了生产环境所需的可靠性属性。我们提出ReliabilityBench,一个从三个维度评估Agent可靠性的基准:(i) 使用pass^k衡量重复执行下的一致性,(ii) 对强度为ε的语义等价任务扰动的鲁棒性,(iii) 对强度为λ的受控工具/API故障的容错性。ReliabilityBench贡献了统一的可靠性曲面R(k,ε,λ)、以终态等价而非文本相似性定义正确性的动作蜕变关系(action metamorphic relations),以及混沌工程式的故障注入框架(超时、速率限制、部分响应、模式漂移)。我们在四个领域(日程、差旅、客服、电商)对两个模型(Gemini 2.0 Flash、GPT-4o)和两种Agent架构(ReAct、Reflexion)进行了1,280个回合的评估。仅扰动一项就使成功率从ε=0时的96.9%降至ε=0.2时的88.1%。消融实验中,速率限制是破坏性最大的故障。在组合压力下ReAct比Reflexion更稳健,且Gemini 2.0 Flash以低得多的成本取得了与GPT-4o相当的可靠性。ReliabilityBench为评估LLM Agent的生产就绪度提供了系统化框架。