论文

多智能体代码裁判何时有依据:两项无标签测量与拒答机制

When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess

模型评测评测方法与指标

摘要

一个语言模型判断另一个模型的代码是否正确时,通常不会报告缺乏证据,而是给出附带推理的自信结论,与有依据的结论难以区分。多智能体验证将判断拆成可检验主张,再用证据逐一核实;在证据来自检索文档时很有效。本文认为,证据须独立于被审答案,且能区分两个候选。第二个条件在检索文档中自然成立,在代码裁判中却可能失效。作者不改动已发表的 MARCH 框架,在两个代码评测基准的 80 个条件—单元测量上运行,发现其在 78%—95% 的比较中判两解同样好;某处准确率仅 4.4%,而直接问同一模型可达 43.7%。更容易的问题或更大裁判均未改变这一现象。两项来自流水线自身日志、无需标签的测量能解释问题。以其中一项作为门控,系统拒绝无法比较的案例,在仍回答全部比较一半的情况下,把准确率从 20.7% 提至 36.9%。贡献并非更准确的裁判,而是无需标签即可判断裁判何时没有作答依据。