论文

Abstain-R1:通过可验证的 RL 校准弃权和拒绝后澄清

Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL

模型训练强化学习

摘要

强化微调提高了大语言模型的推理能力,但它也可以鼓励他们通过猜测或幻觉缺失的信息来回答无法回答的查询。现有的弃权方法要么训练模型产生一般拒绝,要么鼓励后续澄清,而不验证这些澄清是否识别了关键的缺失信息。我们研究含义明确但无法从给定信息中可靠解决的查询,并认为可靠的模型不仅应该放弃,还应该解释缺失的内容。我们提出了一种澄清感知 RLVR 奖励,在奖励可回答查询的正确答案的同时,联合优化对不可回答查询的明确弃权和语义上一致的拒绝后澄清。使用这个奖励,我们训练 Abstain-R1,这是一个 3B 模型,可以提高对无法回答的查询的放弃和澄清,同时在可回答的查询上保持强大的性能。 Abstain-Test、Abstain-QA 和 SelfAware 的实验表明,Abstain-R1 对其基本模型进行了大幅改进,并实现了与包括 DeepSeek-R1 在内的更大系统竞争的不可回答查询行为,这表明可以通过可验证的奖励来学习校准的弃权和澄清,而不是仅从规模中出现。