论文

AMEL:累积消息对LLM判断的影响

AMEL: Accumulated Message Effects on LLM Judgments

模型评测模型行为与机制分析

摘要

大语言模型常被用作自动评估器:审查代码、审核内容或给输出打分,且常常是许多条目在同一对话中依次处理。我们追问先前对话历史的极性是否会使后续判断产生偏差,并将这一效应称为LLM判断中的累积消息效应(AMEL)。在对来自5家提供商(OpenAI、Anthropic、Google、DeepSeek及四个开源模型)的12个模型进行的84,088次API调用中,我们将相同的测试条目单独呈现,或置于以正面或负面评价为主的历史之后。模型会向对话的主导极性偏移(d = -0.17,p < 10^-53)。该效应集中在模型基线真正不确定的条目上(高熵条目d = -0.36,而基线确定时为d = -0.15)。偏差不随上下文长度增长:前5轮与前50轮产生相同偏移(Spearman |r| < 0.01;OLS斜率p = 0.80)。并且存在负面不对称:按条目配对,负面历史诱发的偏差是正面的1.52倍(t = 13.03,p < 10^-36,n = 2,733)。扩大模型规模有缓解但不解决问题(Anthropic:Haiku -0.22到Opus -0.17;OpenAI:Nano -0.34到GPT-5.2 -0.17)。三项后续实验进一步收窄了机制解释。Token概率分布是连续偏移的,而非在某个阈值处突变。负面不对称兼有token级与语义成分,不过在我们的样本量下,对两者占比的归因仍属探索性。位置无关紧要:在50轮历史中任意位置放入五个带偏见的轮次都产生相同偏移。对评估流水线而言,最简单的修复是每个条目使用全新上下文;当批处理不可避免时,平衡历史内容也有帮助。

AMEL:累积消息对LLM判断的影响
图 11:偏差热图,非饱和条件。蓝色=符合(更“不”);红色=逆势。值是平均偏差分数。无垂直梯度 ⇒ \右箭头无累积。