论文

回答或弃权:通过弃权感知强化学习减轻搜索代理幻觉

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

模型训练强化学习Agentic RL

摘要

为 大语言模型 (LLM) 配备搜索工具和结果奖励强化学习 (RL) 的最新进展在开放域 QA 任务上取得了最先进的结果。然而,我们认为当前的训练范式存在一个严重的漏洞:它们主要奖励正确的答案,但在检索失败时无法惩罚捏造的答案,从而隐含地加剧了幻觉。为了解决这个问题,我们提出了弃权感知强化学习(AWA-RL),它利用模型特定于查询的先验能力和连续的 同策略 训练观察来动态地塑造弃权奖励。我们还引入了一种新颖的指标 RA-F1 来衡量能力与可靠性的权衡。与非弃权基线相比,AWA-RL 的绝对精度提高了 10.3%,整体 RA-F1 提高了 2.9%,而原始精度仅略有牺牲。这些结果证实 AWA-RL 成功地产生了高性能且可靠的搜索代理。代码、数据和模型权重可在 https://github.com/zfj1998/AWA-RL 上公开获取。