论文
TelcoAgent-Bench:电信 AI 代理的多语言基准
TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents
摘要
将 大语言模型 (LLM) 代理集成到电信网络中带来了与意图识别、工具执行和解决方案生成相关的新挑战,同时考虑到不同的操作约束。在本文中,我们介绍了 TelcoAgent-Bench 和 TelcoAgent-Metrics,这是一种用于评估多语言电信 LLM 代理的电信特定基准测试框架。所提出的框架评估语义理解以及流程级与结构化故障排除流程的一致性以及重复场景变化的稳定性。我们的贡献包括一套结构化的指标,用于评估意图识别、有序工具执行、解决方案正确性以及跨场景变化的稳定性,目的是量化电信环境中 LLM 代理的可靠性和操作一致性。该框架设计为以英语和阿拉伯语运行,以满足运营网络环境中多语言代理部署的需求。我们的实验结果表明,尽管最近的指令调整模型可以以合理的方式理解电信问题,但它们通常很难始终如一地遵循所需的故障排除步骤,并在暴露于同一场景的不同变化时保持稳定的行为。这种表现差距在不受限制的双语环境中变得更加明显。