论文

CrossHallu:大语言模型 内部的幻觉信号是否可以跨语言和跨领域泛化?

CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 中最近的幻觉检测技术侧重于直接从模型的内部表示中提取特征,并根据这些特征训练分类器来检测幻觉,展示了有希望的结果。尽管取得了这一进步,但大多数内部状态幻觉检测技术主要是用英语进行探索的,这就提出了这样的内部信号是否可以跨不同语言和领域泛化的问题。为了解决这一差距,我们提出了 CrossHallu,这是第一项使用来自六个 LLM 的内部表示来评估幻觉检测的跨语言和跨领域泛化的研究。我们使用TruthfulQA(TruthfulQA 的阿拉伯语翻译版本)和 HalluScore 进行系统的阿拉伯语 <-> 英语评估。该评估包括单语训练和测试、跨语言迁移、跨域迁移以及跨语言和跨域迁移相结合。结果表明,LLM 中的内部状态幻觉信号在大多数模型中跨语言和域传输,跨语言性能高度依赖于特征空间中的类可分离性和语言对齐,而阿拉伯语中的跨域传输则根据用于幻觉检测器的训练和测试数据集而变化。该代码可在 https://github.com/aishaalansari57/CrossHal 上公开获取。