论文
精确但未耦合:多智能体数学推理中评审精度不保证意见被采纳
Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
摘要
许多面向数学与科学的智能体系统采用带专职评审角色的分层设计,默认设置专门的评审阶段有助于把错误候选改正为正确。我们在4,181道以验证器校准的Omni-MATH问题上、用配对的gpt-oss-120b执行者检验这一假设。在最简单的层级上,协作几乎不增益;但从第4层起收益显著拉开,且在这一更难的区间,广播式同伴讨论的最终准确率高于规划者—执行者—评审者流水线(PER)。我们追问这一差距究竟由评审质量解释,还是由“评审意见是否改变协议携带的下一个答案”解释。结果表明它并不能仅由评审精度解释:PER的评审者比广播式更精确(0.861对0.644),但经验证器确认的有用意见却更不容易改变下一个候选答案,评审引导的修复产出也更低。这些结果显示评审者的检出质量与意见采纳率在经验上可分离。在配对的PER干预中,强制显式确认意见反而降低最终准确率,而把评审引导直接嵌入求解器的工作上下文能部分改善执行但无法消除差距。总体而言,以评审为中心的评估可能高估系统质量:一个协议也许很会挑错,但若不把意见落实为行动,仍解不出更多题目。
