论文

对抗自博弈的竞争成分能否改善法律推理?一项受控的负面结果

Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result

模型评测评测方法与指标

摘要

对抗性自我博弈是法律推理的一种令人信服的配方:让一个学生模型草拟论点,让一个对手模型攻击它,并在论点通过攻击后给予奖励。我们设计了这样一个训练信号——一个可验证的“生存”奖励,其中学生的引用文献和对手的反驳文献都由引文验证者检查,因此生存权决定在经过验证的基础上,而不是通过口舌之争,伪造的引文自动被中和。然后我们问了一个狭窄但重要的问题:竞争成分本身——对手和生存奖励——是否在与之完全相同的非竞争性训练中额外提供价值?在四个独立的测试中——一个自举比较、一个两个种子重演、一个对生成的抗辩性鲁棒性的对比、一个盲目的对手对头判断——竞争成分没有产生可靠的益处。盲目的判断给出了49%的胜率(二项分布p接近1.000);强化对手的试点给出了50%的胜率(32:32,p接近1.000)。一个早期的+29%的优势反转并证明是一个小样本效应。我们报告这个结果为一个诚实的负结果。论文的价值在于可重复性和分享具体陷阱:一个最初看起来有效的度量指标在更多数据上倒转了,一个对抗性鲁棒性的度量指标无声地崩溃为简单的召回率,当对手不再引用相同的权威文献时。这个空白与同行的代码领域研究(Kim,2026,arXiv:2607.08255)的结论一致,即多教师课程的价值在于构建可验证的环境,而不是竞争本身。