论文

Terminal-Bench-LILT:基于语言、地区和文化的多语言代理编码基准

Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture

智能体系统Agent任务评测

摘要

编码智能体 的大多数评估仅以英语进行,这并不反映现实世界的多语言部署。我们推出了 Terminal-Bench-LILT,这是一套包含 300 个真实编码任务的套件,支持十种语言:阿拉伯语、捷克语、德语、西班牙语、印地语、日语、韩语、塞尔维亚语、土耳其语和中文。每个任务都针对非英语软件开发的特定问题,这些问题没有直接的英语对应项,例如国际化、编码、文本规范化和文化惯例。所有任务均由母语程序员编写,并通过多阶段质量控制管道进行验证。对六个前沿模型的评估表明,即使是最强的模型也只能达到 63.1% 的通过率,许多任务是任何模型都无法解决的。性能因语言而异,并且不跟踪一般编码基准排名,这突显多语言编码能力是一个独特且尚未充分开发的能力轴。示例任务位于 https://github.com/lilt/terminal-bench-lilt