论文
BAPO:面向可靠 Agentic 搜索的边界感知策略优化
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
摘要
基于 RL 的 Agentic 搜索使 LLM 能够通过动态规划与外部搜索解决复杂问题。虽然通过大规模强化学习优化智能体策略显著提升了准确率,我们识别出可靠性方面的关键缺口:这些智能体无法识别自身的推理边界,即便证据不足或推理达到极限,也很少承认“我不知道”(IDK)。这种可靠性缺失常导致看似合理却不可靠的答案,在许多真实场景中引入重大风险。为此,我们提出边界感知策略优化(BAPO),一个旨在培育可靠边界意识而不牺牲准确率的新型 RL 框架。BAPO 引入两个关键组件:(i) 基于组的边界感知奖励,仅在推理达到极限时鼓励 IDK 回应;(ii) 自适应奖励调节器,在早期探索阶段策略性地暂停该奖励,防止模型把 IDK 当作捷径。在四个基准上的大量实验表明,BAPO 大幅增强了 Agentic 搜索的整体可靠性。
