论文

BAPO:面向可靠 Agentic 搜索的边界感知策略优化

BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search

模型训练强化学习Agentic RL

摘要

基于 RL 的 Agentic 搜索使 LLM 能够通过动态规划与外部搜索解决复杂问题。虽然通过大规模强化学习优化智能体策略显著提升了准确率,我们识别出可靠性方面的关键缺口:这些智能体无法识别自身的推理边界,即便证据不足或推理达到极限,也很少承认“我不知道”(IDK)。这种可靠性缺失常导致看似合理却不可靠的答案,在许多真实场景中引入重大风险。为此,我们提出边界感知策略优化(BAPO),一个旨在培育可靠边界意识而不牺牲准确率的新型 RL 框架。BAPO 引入两个关键组件:(i) 基于组的边界感知奖励,仅在推理达到极限时鼓励 IDK 回应;(ii) 自适应奖励调节器,在早期探索阶段策略性地暂停该奖励,防止模型把 IDK 当作捷径。在四个基准上的大量实验表明,BAPO 大幅增强了 Agentic 搜索的整体可靠性。

BAPO:面向可靠 Agentic 搜索的边界感知策略优化
图4:BAPO 的整体框架。其训练过程始于 (a) agentic reasoning(智能体式推理),模型通过将思考过程与搜索环境交互交替进行,为每个问题生成一组 rollout。这些 rollout 随后被传入 (b) 奖励计算模块,该模块由以下部分组成:(b.1) 正确性奖励 ℛ Correct \mathcal{R}^{\textit{Correct}},由格式与结果的正确性导出;(b.2) 边界感知奖励 ℛ IDK \mathcal{R}^{\textit{IDK}},设计用于在组内不存在正确 rollout 时激励 IDK 回应;(b.3) 自适应奖励调节器,在探索阶段基于 IDK 比例、在平台阶段基于 rollout 的多样性,自适应地禁用 ℛ IDK \mathcal{R}^{\textit{IDK}}。