论文
NormWorlds-CF:使用变形关系 GRPO 进行求解器验证的反事实规范推理
NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO
摘要
语言模型可以出于错误的原因得出正确的规范性判决。我们引入 NormWorlds-CF,这是一个经过求解器验证的环境,用于在可执行规则世界中进行反事实规范推理。其确定性求解器产生最终答案、证明和证伪证书、论证状态、支持集和配对世界变化标签,从而无需 LLM 法官即可进行监督和评估。该基准测试包含分阶段 SFT 诊断和一个紧凑的配对世界任务,其中包含 270 个根族和 1080 个规范到变体对。 SFT 诊断表明,最终答案监督可以在不诱导伪造能力的情况下使判决准确性饱和:仅答案 SFT 达到完美的答案准确性,但在联合伪造证书上得分为零,而具有目标重播的全混合训练则达到了很强的全任务准确性 (0.99)。对于结构化变更任务,我们引入了变形关系 GRPO(MR-GRPO),这是 GRPO 的类条件奖励,为关系族和求解器可见的变更字段提供部分功劳。在匹配的 Qwen3-1.7B 延续实验中,与稀疏和仅答案的 GRPO 相比,MR-GRPO 提高了保留的关系准确性和关系族正确性,并减少了错误族错误。在 Qwen3-4B 三种子验证中,稀疏奖励最好地保留了粗略关系标签,仅答案奖励改善了答案变化,但削弱了关系族结构,MR-GRPO 在答案、支持和状态变化领域以及类条件 MR 和变化存在方面领先。这些结果表明,经过验证的反事实结构可以塑造 后训练 超越最终答案,而精确的完整变更记录生成、不变子类型识别和分布外 (OOD) 传输仍然是悬而未决的问题。