论文
JuICE:评估 LLM-Judge 识别文化错误的基准
JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
摘要
随着 大语言模型 (LLM) 越来越多地部署到世界各地的用户,它们被集成到不同文化背景下的日常任务中,从起草个人通信到集思广益的创意。这些任务本质上是文化性的:它们需要语境的适当性、象征性的共鸣以及母语人士本能地利用的默认文化期望,这意味着对于当地读者来说,回应可能实际上是合理的,但无疑是错误的。现有的文化基准通过事实验证或规范蕴含方法将文化视为一组扁平的事实,并采用了 LLM-as-a-Judge,而没有检验它们是否能够捕获如此严重的文化错误。为了解决这一差距,我们提出了 JuICE(LLM-Judge 识别文化错误的基准),这是一个多语言数据集,包含长格式 LLM 响应中的文化和语言错误的 7,470 个跨度级别注释。它涵盖了来自四个国家(美国、韩国、印度尼西亚和孟加拉国)的 1,050 个查询-响应对,包括英语及其国家的主要语言。使用 JuICE,我们发现即使是最强的 LLM-judge 在错误跨度检测任务中也只能达到 0.52 的 F1。此外,LLM 法官始终忽视当地居民容易识别的文化错误。我们的研究结果表明,强有力的文化评估必须超越表面层面的检测,转向考虑文化意义的深度和情境性的框架。