论文

超越直译:评估社交媒体 UGC 的文化有效性

Beyond Literal Translation: Evaluating Cultural Effectiveness in Social Media UGC

模型评测基准与评测资源

摘要

社交媒体平台实现了大规模的跨语言交流,但由于其非正式的风格、文化参考和基于交互的表达方式,翻译用户生成内容 (UGC) 仍然具有挑战性。虽然最近的 LLM 提高了翻译质量,但现有的基准和指标往往无法捕捉翻译是否在现实环境中传达了预期含义和文化共鸣。在这项工作中,我们介绍了 CULTURE-MT,这是社交媒体翻译的基准,重点关注文化传播和 UGC 特定的情感共鸣。 CULTURE-MT 包含 14 个领域的 1,002 个 UGC 注释,根据文化负载符号和语言风格特征分为四种类型。我们还构建了面向 UGC 的训练数据,以微调 Qwen3-8B 和 Qwen3-32B 作为基线。我们提出文化有效性作为新的评价标准,重点关注表达准确性和文化适应性。测试了 15 个模型(包括基线),我们发现传统指标无法捕捉文化有效性。我们还观察到,基于 LLM 的文化有效性与模型大小相关。我们的工作为 UGC 翻译模型提供了一个全面的评估体系,并将提供一个开放的评估平台来推进该领域的研究。我们发布了 CULTURE-MT 基准,并提供在线排行榜,我们训练有素的 JUDGER 可以在其中评估提交的翻译结果。