论文
SAAS:面向 Agentic Search 过度搜索缓解的自我感知强化学习
SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search
摘要
Agentic search 使 LLM 能够通过迭代推理与外部搜索解决复杂的多跳问题。尽管行之有效,这类系统在实践中常受一个关键局限的困扰:智能体无法认识自身的知识边界,在内部知识已足够时仍盲目触发搜索,而在已收集充分证据后仍无法终止搜索。自我感知的缺失导致严重的过度搜索(over-search),带来可观的推理延迟与高昂到难以承受的计算成本。为此,我们提出 SAAS,一个旨在培养动态自我感知的新型强化学习(RL)框架,能在不牺牲准确率的前提下精确调控搜索行为。SAAS 引入三个关键组件:(i)搜索边界建模机制,通过对比禁用搜索与启用搜索的 rollout 来识别策略演化下的搜索边界;(ii)边界感知奖励模块,将这种边界感知转化为轨迹级惩罚,抑制不必要与冗余的搜索;(iii)分阶段优化策略,利用序贯课程使推理优化先于搜索正则化,从而避免奖励劫持(reward hacking)。大量实验表明,SAAS 在保持准确率的同时大幅减少过度搜索。我们的代码与实现细节已发布于 https://github.com/XMUDeepLIT/SAAS。
