论文
迷失在解释中:跨语言解释中的合理性-忠实性 权衡
Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations
摘要
多语言部署的 LLM 通常通过非英语输入的英语解释进行审核。我们评估提取性解释,“模型将输入标记范围识别为证据以及生成的基本原理”,并揭示了系统性的权衡:以英语为中心的解释可以与人类基本原理实现更高的跨度一致性,而它们的证据在模型预测中的因果关系变得不那么扎根(通过全面性和充分性来衡量)。在 3 个任务、5 个语言和 2 个多语言 LLM 系列中,我们发现英语解释经常产生流畅但松散锚定的基本原理,其全面性相对于母语条件下降高达 5.7 倍 - 即使任务准确性在不同设置中保持稳定。对于社会细微差别的分类,英语枢轴也无法保留实用线索,从而减少了 忠实性 和跨度一致性。我们建议审核输入语言的解释,报告词汇重叠之外的多方面 忠实性 指标,并将英语基本原理视为沟通摘要而不是忠实的决策痕迹。