论文
GAIA-v2-LILT:代理基准的多语言适应超越翻译
GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation
摘要
代理基准测试仍然主要以英语为中心,而其多语言版本通常是通过机器翻译 (MT) 和有限的后期编辑构建的。我们认为,对于代理任务,这种最小的工作流程很容易通过查询-答案不一致或文化偏离目标上下文来破坏基准有效性。我们提出了一种改进的工作流程,通过使用自动检查和人工审核,将英语基准调整为多种语言,并具有明确的功能对齐、文化对齐和难度校准。使用此工作流程,我们引入了 GAIA-v2-LILT,这是 GAIA 的重新审核的多语言扩展,涵盖五种非英语语言。在实验中,我们的工作流程比最低翻译版本将代理成功率提高了 32.7%,将最接近的审核设置与英语性能的误差控制在 3.1% 以内,而在许多其他情况下仍然存在巨大差距。这表明多语言性能差距的很大一部分是基准引起的测量误差,在跨语言调整英语基准时激发了任务级别的调整。该数据作为 MAPS 包的一部分提供,网址为 https://huggingface.co/datasets/Fujitsu-FRE/MAPS/viewer/GAIA-v2-LILT。我们还在 https://github.com/lilt/gaia-v2-lilt 上发布了实验中使用的代码。