论文
大语言模型的从众缓解方法落在单一的抵抗-接纳前沿上
Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier
摘要
语言模型的最新进展使多模型协作场景成为可能:多个模型互相利用彼此的能力,迭代地改进、转换并扩展彼此的输出。每个智能体在回答前都会看到其他模型的断言,于是同伴意见与模型自身的参数化知识相竞争,一个错误的多数派可以推翻模型原本能答对的答案。我们在23个开放权重模型、19种条件和三个数据集上测量这种位移,产生超过一百万条分级响应。一个一致的错误多数派会翻转模型在MMLU上22.8%的正确答案、GPQA上的54.8%和SimpleQA上的71.0%,其中84-89%的被翻转答案与同伴的答案一致。现有缓解措施旨在提高Resistance(抵抗率,即模型在这种压力下保持正确答案的比率),但这只是协作智能体所需的一半。我们将其与Receptivity(接纳率,即模型在最初答错后采纳同伴正确答案的比率)配对。我们在两个维度上对六种方法评分,其中四种来自先前工作、两种为我们自研。每种方法都以损失接纳率为代价换取抵抗率,其均值落在单一的抵抗-接纳前沿上,R²介于0.80至0.90之间。Reflection是最强的已发表方法,在MMLU上获得7.9点抵抗率,却付出15.3点接纳率。推理是唯一的例外。在GPQA与SimpleQA上它的交换方式与其他方法相同,但在模型能自行推导出答案的MMLU科目上,它同时将抵抗率提高7.2点、接纳率提高9.6点,是我们发现的唯一能同时改善两者的干预。
