论文

蒸馏与对齐分解以增强声明核查

Distill and Align Decomposition for Enhanced Claim Verification

模型训练强化学习RLVR

摘要

复杂声明核查需要将句子分解为可核查的子声明,但现有方法难以使分解质量与核查性能对齐。我们提出一种强化学习(RL)方法,使用 Group Relative Policy Optimization(GRPO)联合优化分解质量与验证器对齐。我们的方法整合:(i) 结构化的顺序推理;(ii) 在教师蒸馏样例上的监督微调;以及 (iii) 平衡格式合规、验证器对齐与分解质量的多目标奖励。在六个评估设定中,我们训练的 8B 分解器将下游核查性能提升至 71.75% macro-F1,优于基于提示的方法(+1.99、+6.24)和现有 RL 方法(+5.84)。人类评估证实了所生成子声明的高质量。我们的框架使较小的语言模型通过联合优化核查准确率与分解质量实现最先进的声明核查。