论文

共同的疑问:语言模型的零样本跨语言置信度估计

Shared Doubt: Zero-Shot Cross-Lingual Confidence Estimation for Language Models

模型评测模型行为与机制分析

摘要

置信度估计(CE),即量化模型预测的可靠性,在 大语言模型 (LLM) 的背景下引起了极大的兴趣。然而,大多数研究都集中在英语上,忽略了 LLM 使用的多语言现实,而许多 CE 方法会降级或需要跨语言重新训练。为了解决这一差距,我们研究了多语言 LLM 是否在开放式问答中编码共享的、可语言转移的置信特征。我们使用轻量级线性探针直接从中间表示预测答案的正确性。该探测器经过单语训练,可以在没有目标语言监督的情况下,将零样本推广到看不见的、语言多样的语言。多重消融和学习层权重表明,置信度特征集中在跨语言的中间层,这表明存在共享的置信度子空间。虽然零样本跨语言性能取决于与源语言的相似性,但该探针无需任何再训练即可提供强大的基线,并且与其他流行的置信度估计方法相比具有优势。