论文

DecomposeRL:学习提出有用、信息丰富且多样化的问题以进行半监督、可追踪的声明验证

DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

模型训练强化学习

摘要

声明验证在端到端分类器之间进行划分,这些分类器是准确的,但不会产生可检查的痕迹,而基于分解的方法会产生可检查的痕迹,但在基准数据集上表现滞后。我们提出 DecomposeRL 是一种准确的声明验证器,可以产生可检查的痕迹。 DecomposeRL 将分解构建为使用 GRPO 和多方面奖励集合训练的 RL 策略,从而能够从未标记的声明中进行完全监督和半监督学习。 DecomposeRL 通过数据管理漏斗解决了 GRPO 高昂的训练成本问题,该漏斗将 115K 事实验证声明提炼成 5K 声明的紧凑、学习信号密集的子集。我们表明,仅对约 5K 精选声明进行全面监督训练的 DecomposeRL-7B 策略在包含生物医学、政治、科学和一般领域声明的 11 个声明验证基准中实现了 86.3 的域内平衡准确度和 69.8 的域外平衡准确度。尽管小了 4 倍,但它与 32B 基线和 GPT-4.1-mini 匹配,并且在只有 10% 标记索赔数据的半监督环境中进一步优于基线。代码、数据和模型可在 https://dipta007.github.io/DecomposeRL 获取