论文

大多数 LLM 一致性不需要说话人:在同行压力基准中测量无说话人底限

Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks

模型评测评测方法与指标

摘要

LLM 一致性通常用于描述模型更改对等或组响应的正确答案的情况。我们表明,即使在同伴被移除后,大多数这种明显的一致性仍然存在。原因很令人困惑:标准的一致性提示同时混合了两种提示:说话者的存在和重复的错误答案本身。现有的基准测试将这些线索放在一起,因此它们无法判断修订实际上有多少取决于演讲者。我们引入一个无源条件:相同的断言答案,但明确的说话人被删除。在六个开放权重 LLM 和七个 QA 和推理数据集中,仅此条件就会在最初正确的案例中造成 66.5\%$ 的有害修改,而在简单的重新询问下则为 10.3\%$。当重复的答案被解释以及答案选项隐藏在开放式环境中时,这种效果仍然存在。源框架主要调节这一层:专家小组框架提高了它,而最小的人员标签并不能可靠地提高它。当模型翻转时,它们通常肯定是错误的,简单的重新校准并不能恢复原始答案。来源归属仍然很重要,但应该以高于无发言者楼层的增量来衡量。方法论的教训是,一致性基准应该首先衡量演讲者被移除后剩下的东西;如果没有这一步,基准测试可能会将重复的文本误认为是社会影响力。