论文

CultureConverse:为东亚和东南亚提供文化援助的多语言多回合模拟工具

CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

模型评测基准与评测资源

摘要

当前对 大语言模型 (LLM) 的文化评估通常会将文化简化为通过 MCQ 的单轮事实回忆,未能捕获常见用例:用户在基于文化的场景中通过多次轮流寻求实际帮助。我们推出了 CultureConverse,这是一种可扩展的多语言模拟和评估工具,用于基于文化的辅助对话,涵盖 10 个东亚和东南亚地区、58 个亚群体身份和 7 个领域。每个模拟和评估的情节都会产生评分交互,其中助手协助用户并从部分信息推断文化约束。生成的 CultureConverse-DS 数据集包含 14,610 个基准(评估)剧集和 274,295 个已知答案引导(标准答案模式)对话。在我们对 18个模型的基准评测中,GPT-5 mini 取得了最高的辅助质量。人类注释实验表明,我们的评估框架足以代表人类判断。 微调 在 27,860 个高质量 CultureConverse-DS 样本上的性能提升改善了域内协助,并将域外转移到文化 MCQ 和安全分类基准。我们发布了Harness、两个数据划分和判断提示,以支持文化能力的交互式评估。