论文
多语言提示污染下的输出语言混乱
Output Language Confusion under Multilingual Prompt Contamination
摘要
标准事实性基准假设干净的单语提示与精确匹配打分——这两个假设在现实多语言部署中同时破裂:从返回混合语言段落的RAG管道到用户粘贴多语言网页内容。我们提出多语言干扰项干扰(MDI)——轻量且完全可复现的评测协议,无需新数据或标注:在事实性问题前加一句语义无关的外语句子,跨TruthfulQA与TriviaQA、八种干扰条件评估五个指令微调LLM(4万次评估)。核心发现是指标混淆:印地语干扰下Llama-3.1-8B有58%响应切换为天城文,产生0.710的原始幻觉代理值;但人工核查显示148个脚本切换响应中120个在干净条件下正确者语义仍然正确(只是写错文字),调整后语义幻觉率降至0.470。其他所有模型都以弃答升级响应,幻觉不增。段长英文干扰在所有模型上触发近乎普遍的弃答(0.806-0.998),与阅读理解混乱一致——这一失败模式对多语言RAG管道有直接后果。TruthfulQA选择题准确率在所有单句条件下不受影响。结果表明:混合语言设置下的精确匹配幻觉率应先分解为脚本切换与语义错误分量,再对模型可靠性下结论。