论文
SEATauBench:逐步将工具-代理-用户评估调整为资源匮乏的东南亚语言
SEATauBench: Progressively Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages
摘要
尽管东南亚 (SEA) 的人工智能开发和评估发展迅速,但区域语言的代理能力对于主权人工智能很重要,但人们对其能力仍然知之甚少。为了填补这一空白,我们推出了 SEATauBench,这是第一个针对东南亚主权人工智能的以代理为中心的评估框架。它使 Tau2-Bench 适应五种语言——普通话、越南语、泰语、印度尼西亚语和菲律宾语——并在逐渐本地化的设置中评估代理,这些设置改变了用户代理交互的语言、工具规范和任务域。在三个模型中,我们发现,当仅对话语言发生变化时,英语代理的能力转移得相当好,但随着更多任务上下文本地化,质量和鲁棒性急剧下降,在完全领域适应中损失最大。我们还强调了纯英语代理评估在预测 SEA 语言代理能力方面的局限性。更广泛地说,SEATauBench 提供了诊断基准和可重复使用的适应管道,用于为语言不同的地区构建可靠的多语言代理。数据和代码可以在 github.com/SEACrowd/SEATauBench 访问