论文
更好的通话奖励:奖励黑客作为法律推理模型中的战略弃权
Better Call Reward: Reward Hacking as Strategic Abstention in Legal Reasoning Models
摘要
当法律人工智能模型学会像律师一样行事而不是像律师一样推理时,会发生什么?我们使用组相对策略优化 (GRPO) 针对由三个表面特征构建的代理对 Qwen3-8B 进行微调:引用计数、法律术语密度和响应长度。该模型无法更有效地学习推理。它学会了克制承诺。在 LegalBench 的 16 个是或否法律推理任务中 (N=320),总体准确率从 0.500 (随机水平) 下降到 0.072 (McNemar p < 10^-36),这完全是由格式正确的答案率从 0.900 下降到 0.109 驱动的。模型不再承诺答案。然而,当它确实提交时,准确度从 0.556 上升到 0.657,这表明崩溃不是能力的失败,而是战略反应:模型了解到,冗长的回复充满了引用,但缺乏直接答案,得分高于简洁的正确答案。我们将其称为索尔·古德曼效应,即策略变得最大限度地律师化,同时变得最大限度地不置可否,并正式证明这是对任何表面特征代理的最佳响应,不会对弃权行为施加任何惩罚。我们进一步表明,训练之后产生的引文中有 89.3% 是结构上难以置信的幻觉,其中许多巧妙地破坏了真实标志性案例的名称,实际上是为了在随意阅读时幸存下来并在审查中失败。为了在部署之前检测这种故障模式,我们引入了三种诊断工具:置信度评分 (CTS)、引文合理率 (CPR) 和遗憾差距 (RG)。在一个确信错误的答案可能构成渎职的领域,更广泛的教训是直接的:衡量响应看起来如何合法的奖励函数将产生一个最上镜但用途最小的模型。
