论文
误导比纠正更容易:LLM 一致性中有害和有益的修订
Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity
摘要
大语言模型 越来越多地用于多代理系统,它们可以在其中查看并响应其他代理的答案。一个关键的风险是一致性:模型可能仅仅因为其他人同意不同的答案而放弃自己的答案。先前的研究表明,LLM 经常会针对多数答案进行修改,但目前尚不清楚这些修改是否与引入新错误一样频繁地有助于纠正错误。在本文中,我们进行了一项对照研究,其中 LLM 首先回答一个问题,然后在做出最终决定之前查看模拟的同伴响应。我们操纵两种社会线索:共识结构和分配给同行的权威标签,并衡量它们如何影响有益和有害的修订。在四个开放权重 LLM 和七个 QA 数据集中,我们发现同行协议使得误导最初正确的模型比纠正最初错误的模型更容易。权威标签使模型更有可能选择认可的答案,无论它是否正确。更令人担忧的是,诸如思维链和反思之类的通用推理干预措施并不能可靠地减少有害的修订,同时保留有益的修订。这些发现表明,多代理 LLM 系统应该验证同伴的答案,而不是简单地聚合它们。