论文

Telco-GAIA:电信领域智能体的英阿双语基准

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

智能体系统Agent任务评测

摘要

我们提出Telco-GAIA,一个双语、多模态基准:在真实电信运营商的数据上评估工具使用型智能体。Telco-GAIA含100个人工验证的问答任务(英语与阿拉伯语),每个任务都要求跨三个异构来源的多跳推理(平均4.2跳):静态网站快照(HTML、图像与链接PDF)、合成的关系型SQL数据库与外部网络存档,横跨文本、图像与表格模态。基准以沙箱Docker环境交付、以归一化精确字符串匹配打分,使评估客观、确定、可随时间复现,无需任何LLM即裁判。以定制的参照智能体评估十二个商业与开源LLM:Telco-GAIA具有挑战性——最强模型也只解决71%的任务;中等成本预算下降至约40%;视觉落地类目最弱,平均后端低于30%,文档与图像理解留有巨大提升空间。Telco-GAIA为企业智能体提供严格可复现的试验台,并为构建封闭域基准提供模板。

Telco-GAIA:电信领域智能体的英阿双语基准:论文配图
图 4:运营商网站通过端口 8080 上的 nginx 在本地提供服务。代理完全像浏览实时站点一样导航此静态快照。