论文
Telco-GAIA:电信领域智能体的英阿双语基准
Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain
摘要
我们提出Telco-GAIA,一个双语、多模态基准:在真实电信运营商的数据上评估工具使用型智能体。Telco-GAIA含100个人工验证的问答任务(英语与阿拉伯语),每个任务都要求跨三个异构来源的多跳推理(平均4.2跳):静态网站快照(HTML、图像与链接PDF)、合成的关系型SQL数据库与外部网络存档,横跨文本、图像与表格模态。基准以沙箱Docker环境交付、以归一化精确字符串匹配打分,使评估客观、确定、可随时间复现,无需任何LLM即裁判。以定制的参照智能体评估十二个商业与开源LLM:Telco-GAIA具有挑战性——最强模型也只解决71%的任务;中等成本预算下降至约40%;视觉落地类目最弱,平均后端低于30%,文档与图像理解留有巨大提升空间。Telco-GAIA为企业智能体提供严格可复现的试验台,并为构建封闭域基准提供模板。
