论文

从“可能”到“是”:语言模型重写中的确定性扭曲

From 'May' to 'Is': Certainty Distortion in Language Model Rewriting

模型评测模型行为与机制分析

摘要

人类越来越多地转向语言模型 (LM) 来塑造信念和推动决策,包括讨论、重写和总结科学文章、新闻和医学报告中的信息。然而,在这些领域中,表达主张的自信程度往往很重要,但人们对 LM 是否忠实地保持置信度知之甚少。在这项工作中,我们研究了 LM 中的确定性扭曲,定义为在旨在保留意义的转换过程中表达的确定性发生有意义的变化。我们提出了一种基于 LM 的评估指标,该指标与总体水平的确定性判断一致。使用这个指标,我们描述了科学和医学通信任务背景下不同规模和模型系列的确定性失真。我们的结果表明,确定性失真会影响高达 75% 的 LM 输出,并且在重写任务中系统地不对称,大多数 LM 增加所表达的确定性的可能性比降低确定性的可能性高 1.5-2 倍。这些效果可能会因重复释义而复合:在医学领域,claude-haiku-4.5 在一次迭代后增加了 20% 示例的确定性,在五次迭代后增加到 40%。基于及时的干预措施可以减少总体确定性扭曲,但不能消除它。总之,这些发现揭示了人们普遍倾向于夸大表达的确定性,这对在高风险领域依赖 LM 的用户有直接影响。