论文
CirrusBench:评估基于 LLM 的代理在真实云服务环境中的正确性
CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments
摘要
大语言模型 (LLM) 不断增强的代理功能使其能够部署在云服务等实际应用中,其中客户助理交互表现出较高的技术复杂性和长期依赖性,从而使得稳健性和解析效率对于客户满意度至关重要。然而,基于 LLM 的代理的现有基准在很大程度上依赖于合成环境,这些环境无法捕获真实客户输入的多样性和不可预测性,通常忽略了实际部署所必需的解析效率。为了弥补这一差距,我们引入了 CirrusBench,这是一种新颖的评估框架,其特点是基于来自真实云服务票据的真实数据。 CirrusBench 保留了技术服务环境固有的复杂的多轮逻辑链和现实的工具依赖关系。除了执行正确性之外,我们还引入了新颖的以客户为中心的指标来定义代理的成功,通过标准化效率指数和多轮延迟等指标来量化服务质量,以明确衡量解决效率。利用我们的框架进行的实验表明,虽然最先进的模型表现出强大的推理能力,但它们经常在复杂、现实的多回合任务中陷入困境,无法满足客户服务所需的高效率标准,这凸显了基于 LLM 的代理在实际技术服务应用中未来发展的关键方向。 CirrusBench评估框架发布于:https://github.com/CirrusAI