论文

代理法官的多语言提示本地化:需求级别评估中的语言和骨干敏感性

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

模型评测评测方法与指标

摘要

在代理代码基准测试中,评估语言通常被视为固定的英语默认值,但我们表明,改变法官的语言可以颠倒骨干排名。我们将 Agent-as-a-Judge 提示堆栈本地化为五种类型不同的语言(英语、阿拉伯语、土耳其语、中文、印地语),并评估了跨三个开发者代理框架和 6 个法官骨干的 55 个 DevAI 开发任务,总计 4950 次法官运行。核心发现是骨干网络和语言相互作用:GPT-4o 在英语方面实现了最高满意度 (44.72\%),而 Gemini 在阿拉伯语方面领先 (51.72\%, $p<0.001$ vs.\ GPT-4o) 和印地语 (53.22\%)。没有一个主干在所有语言中占主导地位,而且主干之间对个人需求判断的一致性也很有限(Fleiss 的 $κ\leq 0.231$)。受控消融进一步表明,本地化法官侧指令(而不仅仅是基准内容)可以发挥决定性作用:在部分本地化的情况下,印地语满意度从 42.8% 下降到 23.2%。这些结果表明,语言应被视为代理基准中的明确评估变量。发布完整的需求级别判断和运行时统计数据以确保可重复性。