论文

基于LLM的贝叶斯引导:模型规模有益,额外的“推理”未必

Bayesian Elicitation with LLMs: Model Size Helps, Extra "Reasoning" Doesn't Always

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)已被提议作为人类专家的替代者,用于估计未知量及其相关不确定性,这一过程被称为贝叶斯引导(Bayesian elicitation)。我们让十一个LLM估计人口统计量——如健康患病率、人格特质分布与劳动力市场数据——并以95%可信区间表达其不确定性,以此进行检验。我们改变每个模型的推理努力(低、中、高),以检验更多“思考”是否改善结果。我们的发现揭示三个关键结果。首先,更大、更强的模型产生更准确的估计,但提高推理努力并未带来一致收益。其次,所有模型都严重过度自信:其95%区间仅有9-44%的时候包含真值,远低于预期的95%。第三,一种称为共形预测(conformal prediction)的统计再校准技术能够纠正这种过度自信,将区间扩展以达到预期覆盖率。在一项初步实验中,为模型提供网络搜索访问反而降低了本已准确模型的预测表现,而对较弱模型略有改善。模型在常见讨论话题上表现良好,但在专业健康数据上表现吃力。这些结果表明,LLM的不确定性估计需要经过统计校正方可用于决策。

基于LLM的贝叶斯引导:模型规模有益,额外的“推理”未必:论文配图
图1:按模型与思考力度对比负对数似然与相对锐度,考察模型规模与额外“推理”对贝叶斯引导的影响。