论文
审阅者能力决定拒绝目标,而不是修复技能:来自 LLM 执行-审阅-修订管道的证据
Reviewer Capability Governs Rejection Targeting, Not Repair Skill: Evidence from LLM Execute-Review-Revise Pipelines
摘要
多代理 LLM 管道越来越多地将角色(包括执行和验证)分配给不同功能层的模型。这样做是因为在每个阶段运行旗舰型号的成本都很高。先前的文献已经证实,验证阶段并不总是有益的,但审阅者的能力相对于执行者来说大致固定。我们改变它。我们用涵盖能力范围小至根本无法解决问题的模型取代审阅者,并衡量每个拒绝的结果。这是通过一组恒定的 100 个奥林匹克数学问题来完成的。跨家庭中层审阅者将最终准确率提高了 12 个百分点,从 52% 提高到 64% (p = 0.0005),且答案损坏为零。相同模型的自我审查在任何情况下都达到了最高的错误检测率(召回率为 0.85),但没有产生显着的收益:它拒绝的频率是修复率的 2.1 倍(15 次对 43%,p = 0.0074),并且错误地拒绝了 35% 的自己正确答案,而跨家庭审查者的正确答案为 2%(配对 p = 0.000015)。事实证明,自审的低损坏率是修订惯性造成的,而不是审稿人质量造成的:在 18 个被错误拒绝的正确答案中,执行者遵守的 3 个都变成了错误,而执行者忽略的 15 个则保持不变。在能力下限以下,该角色变得惰性:我们最弱的审阅者更改了 100 个最终答案中的零个,同时使词元成本加倍。这些发现描述了针对 100 个问题的单一执行者-审核者配置,应将其视为受控试点,而不是关于验证阶段的一般主张。