论文
一轴,无刹车:自我认识限制了大语言模型过滤有害同行的行为
One Axis, No Brake: Self-Knowledge Limits the Filtering of Harmful Peer Conformity in LLMs
摘要
多代理 LLM 系统预计会更加可靠,因为代理可以发现彼此的错误。但同侪压力是双向的:纠正错误答案的同样纠正可能会推翻正确答案。诱人的保护措施是一个制动器,可以保留有益的修改并阻止有害的修改。我们证明这种制动很难建立,原因很简单:当原始答案正确时,修订是有害的,因此决定是否阻止它与了解模型是否已经正确是一样的。这将对制动器的开放式搜索变成了一个可测量的量,即模型的自我认知:任何根据部署时间信号构建的制动器都是伪装的正确性探针,而自我认知远非完美(AUROC $\大约 0.64$--$0.89$ 在六个模型系列中)。我们称这个天花板为墙。即使模型自身正确性方向的白盒控制也不会违反它:它改变了模型修改的频率,但有害和有益的修改一起移动。在人口规模上,围墙变成了悬崖:当大多数代理人一开始就犯了错误时,辩论会将共同的错误放大为自信的、错误的共识。在我们的多项选择社会中,更多的代理人、更多的模型多样性和更强大的成员并不能解决这个问题。有用的是在修订之前添加信息,而不是在修订之后进行过滤。局部一致并不代表全局正确。