论文

阿拉伯语提示与英语工具:一个基准

Arabic Prompts with English Tools: A Benchmark

模型评测基准与评测资源

摘要

大语言模型(LLM)如今已是众多行业不可或缺的组成部分,越来越多地充当通过工具使用执行复杂任务的自主 Agent 的核心推理引擎。虽然阿拉伯语原生 LLM 的开发正在加速,但评估其能力的基准相对滞后,现有框架大多聚焦英语。工具调用是一个关键却被忽视的领域:以阿拉伯语等非英语语言进行提示的模型表现如何,人们知之甚少,尤其这些模型往往主要在英语数据上预训练。本文通过引入首个专门评估 LLM 阿拉伯语工具调用与 Agentic 能力的基准来填补这一关键空白。我们的工作提供了一个标准化框架,用于衡量模型在阿拉伯语 Agentic 工作流中的功能准确性与鲁棒性。我们的发现揭示了一个巨大的性能差距:当用户用阿拉伯语交互时,无论工具描述本身是阿拉伯语还是英语,工具调用准确率平均下降 5-10%。通过揭示这些关键挑战,该基准旨在促进为阿拉伯语用户开发更可靠、语言上更公平的 AI Agent。