论文

OptimismBench:语言模型判断中的预测偏差和对齐效应

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

模型评测基准与评测资源

摘要

大语言模型 越来越多地用作决策辅助工具,其概率判断决定下游选择。这些判断是否带有系统性的方向性倾斜一直很难检测:校准指标汇总了无符号误差,而自然不确定性不提供 真值 概率。当 LLM 对一家初创公司的成功评价为 70%,但其失败评价为 15% 时,缺失的 15 分暴露了无总分标记的扭曲。我们引入了 OptimismBench,它通过倒置对检测方向偏差:每个场景都会引发 P(成功)和 P(失败),并且两个框架之间的不对称性会产生一个带符号的偏差分数,而无需 真值。在 8 家提供商的 16 个模型中,有 14 个模型持乐观态度;悲观主义只出现在 Anthropic 的前沿层。四个家族中的 11 个匹配的碱基与聊天对显示 后训练 设置了偏差的符号,不同家族中的变化相反。这种模式经受住了及时、温度、视角和自我消除偏见的消融。 17 个模型、6 种语言的比较进一步显示模型同一性在语言中占主导地位,模型间方差为语言间方差的 4.7 倍。我们发布了 10 种语言的 3,870 个项目,用于每个模型的方向偏差审核。当对齐使模型更有用时,它也会倾斜其概率。下游管道默认继承倾斜。