论文

真实性信号能否经受住代码混合的考验?探索印度英语中幻觉检测的隐藏状态

Does the Truthfulness Signal Survive Code-Mixing? Probing Hidden States for Hallucination Detection in Hinglish

模型评测鲁棒性、公平性与可信度评测

摘要

隐藏状态幻觉探测——在大语言模型的内部激活上训练线性分类器,以检测生成的答案是否忠实于输入——是 2026 年研究的一个活跃领域,最近的工作报告跨多个基准和语言的 AUROC 为 0.90-1.00。然而,尽管大量聊天机器人用户使用印地语-英语代码混合文本(“Hinglish”)编写,但这些工作都没有测试过对代码混合输入的探测。我们直接解决这个差距:在干净语言隐藏状态上训练的幻觉探针是否会转移到印度英语,或者信号在代码混合下是否会退化?我们构建了一个包含 5,674 项印地语/英语/印度英语的 QA 基准,在三个开放权重 7-8B LLM(Qwen2.5-7B、Mistral-7B、Llama-3.1-8B)中生成并标记 17,022 个模型响应,提取两个标记位置的每层隐藏状态,并训练线性和 MLP 探针以进行分布内检测和跨语言传输。我们发现幻觉信号在代码混合中保存得很好:转移 AUROC 范围从 0.88 到 0.99,相对于分布内性能,差距大多低于 0.05 AUROC,并且印地语训练的探针比英语训练的探针更可靠地转移到印度英语。作为一项独立的、具有实际动机的发现,对于匹配的事实,所有三个模型对印地语和印度英语的幻觉远多于对英语的幻觉。我们发布了我们的代码和合成的印度英语 QA 数据集,以支持代码混合幻觉检测的进一步工作。