论文

精确但未耦合:多智能体数学推理中评审精度不保证意见被采纳

Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning

模型评测模型行为与机制分析

摘要

许多面向数学与科学的智能体系统采用带专职评审角色的分层设计,默认设置专门的评审阶段有助于把错误候选改正为正确。我们在4,181道以验证器校准的Omni-MATH问题上、用配对的gpt-oss-120b执行者检验这一假设。在最简单的层级上,协作几乎不增益;但从第4层起收益显著拉开,且在这一更难的区间,广播式同伴讨论的最终准确率高于规划者—执行者—评审者流水线(PER)。我们追问这一差距究竟由评审质量解释,还是由“评审意见是否改变协议携带的下一个答案”解释。结果表明它并不能仅由评审精度解释:PER的评审者比广播式更精确(0.861对0.644),但经验证器确认的有用意见却更不容易改变下一个候选答案,评审引导的修复产出也更低。这些结果显示评审者的检出质量与意见采纳率在经验上可分离。在配对的PER干预中,强制显式确认意见反而降低最终准确率,而把评审引导直接嵌入求解器的工作上下文能部分改善执行但无法消除差距。总体而言,以评审为中心的评估可能高估系统质量:一个协议也许很会挑错,但若不把意见落实为行动,仍解不出更多题目。

精确但未耦合:多智能体数学推理中评审精度不保证意见被采纳:论文配图
图 5:交叉评估者分歧的稳健性。 (a) 分组条比较完整基准上的成对分歧率(N=16,724N=16{,}724;浅色条)与重点硬协作切片(PER 和广播,第 7-10 层,N=1,694N=1{,}694;深色条)。 Cohen 的 κ\kappa 注释在每个小节上方。总体一致性很高(不一致 3.4–5.8%,κ=0.850\kappa=0.850–0.9150.915),但在硬协作切片上不一致大约加倍(5.3–9.7%,κ=0.755\kappa=0.755–0.8750.875)。 (b) 硬协作切片的 gpt-oss-120b 与 Llama 分歧热图,按层和协议分层。分歧集中在第 8-9 层 (∼\sim9-12%);第 10 层每个协议只有 15 个实例,其较低的速率不应被过度解释(阴影线)。该模式证实了主要的协议故事不是一个微不足道的单一评估者工件,但评估者的敏感性在答案等价性最模糊的地方是真实的。