论文

无需说服的一致:一轮辩论就抹去了验证所需的分歧

Unanimity Without Persuasion: A Single Round of Debate Erases the Disagreement That Verification Needs

模型评测模型行为与机制分析

摘要

辩论面板可以变得一致却并不变得更正确。这对下游安全防护是危险的:被替换的验证选票只能改变微弱优势的投票,而更丰富的仲裁者会失去分歧这一天然的定位信号。我们展示一轮辩论就能在不需要说服的情况下抹去这一资源。通过追踪一个异构的7评判者面板在600个代码正确性候选上经历一轮盲评和三轮辩论,固定队列上的一致率在第1轮就从39.5%跃升至95.2%(占总崩溃的93.1%),而准确率变动不到一个百分点,且96.3%的判决翻转跟随展示出的同伴多数。一个基于执行的验证选票在辩论前的2,037个候选替换实例中纠正了8个,但在之后的每一轮中改变数为零;到第3轮,每个错误决策都是一致的,抹去了原本标记了面板三分之二错误的异议。同队列对照实验解释了原因:无同伴的重新考虑复现了79.6%的崩溃,不带推理的真实标签复现了91.5%,而随机标签会把翻转引向它们所展示的任何内容;完整辩论条件相比仅标签多贡献4.3个百分点(聚类95%置信区间0.7—8.1)。单轮崩溃在另两次真实运行和两个假标签种子中复现,在3—7的面板规模下持续存在,并出现在MATH-500上。解析失败集中在有争议的候选上(p<0.001),使样本流失不可忽略。设计含义是可操作的:在任何二次评估或同伴暴露之前先做验证,并且绝不要把辩论后的一致性当作可靠性的独立证据。

无需说服的一致:一轮辩论就抹去了验证所需的分歧:论文配图
图 1:机制概览。各轮指标使用固定的 n=291 队列:一轮辩论使一致性从 39.5% 提升到 95.2%,关键案例从 10 个降到 2 个,执行选票替换的实际翻转数降至 0/2,037。对照标注使用单独匹配的 n=280 队列(第 5 节)。