论文

事实检查强化学习Agent中源信任捷径的多渠道缓解

Multi-Channel Mitigation of Source-Trust Shortcuts in Fact-Checking RL Agents

模型训练强化学习RLVRAgentic RL

摘要

检索增强型事实核查人员通常会为每个证据来源贴上可靠性标签,例如“高”或“低”信任度。这些标签应该调整模型的置信度及其寻找更多证据的决定,而判决应该遵循证据内容。我们引入了 TrustSwap,这是一种反事实测试,可以交换、降低或删除源标签,同时保持每个证据文本固定,并分别测量其三个输出通道(判决、置信度和搜索决策)。在两个尺度、三个数据集和两个提示的未经训练和 RL 训练模型中,置信度和搜索在 50 次比较中的 49 次中按照预期响应标签,但仅标签更改就改变了 Qwen3 模型 4-23% 的置信判断,而对于现有 RL 训练的事实检查器则改变了高达 50%。标准 GRPO 微调在所有六种设置中将这种快捷方式放大到 8B。为了减少这种情况,我们提出信任交换增强(TSA),它在同一黄金判决下使用其原始证据和标签交换证据对每项主张进行 GRPO 训练。在 4B 中,TSA 在六种设置中的四种中将判决翻转率降低了 7-35%(相对),保持了准确性和预期的置信度和搜索响应,在主要设置中优于基于奖励的替代方案,并延续到了看不见的标签删除扰动。额外的一致性奖励有助​​于训练交换,但对看不见的扰动没有帮助。在 8B 时,TSA 的影响无法检测到,这使得规模成为主要的悬而未决的问题。