论文
从推理中估计不确定性:LLM 中多语言和跨语言 MCQA 性能的大规模研究
Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs
摘要
不确定性估计 (UE) 使 LLM 支持的系统能够识别何时弃权,但现有的研究主要集中在英语上。我们首次对跨 22 种语言的 UE 方法进行大规模评估,涵盖高、中、低资源设置。使用两个人工策划的问答数据集,我们比较了不同模型大小和架构的开放式和封闭式 UE 方法(总共九种),同时引出长形式推理,避免 LLM 作为法官和基于嵌入的评分,这可能会引入评估噪声。我们报告了三个主要的可操作的发现。首先,我们发现提示模型用英语进行推理,同时用低资源语言保留问题可以显着提高 UE 性能,这表明对低资源语言的理解基本上完好无损,并且可靠性瓶颈在于生成而不是理解。其次,提示模型用英语进行推理可以缩小低资源语言和高资源语言之间的 UE 性能差距,这表明生成语言比问题语言更重要。第三,UE方法的选择应取决于模型规模:在较小的规模下,基于开箱概率的方法优于替代方法;在更大的尺度上,封闭的自我语言的不确定性变得更优越。最后,我们对选择性预测的阈值选择进行了分析,为校准多语言环境中的弃权提供了指导。