论文
一种策略,任意预算:通过强化学习内化预算感知搜索
One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning
摘要
虽然强化学习使基于 LLM 的搜索代理能够调用外部工具,但现有方法在固定预算下进行训练,并且无法适应部署时约束变化的情况。我们提出了 AnySearch,这是一个框架,使单一策略能够通过训练支架和课程强化学习在任何预算约束下执行预算感知搜索。在第一阶段,我们通过明确的预算状态注入和结构化推理提示来训练代理,以指导线性衰减预算下的有效分配。在第二阶段,支架被移除,代理学习在自适应采样预算约束下自主操作,匹配推理条件。这两个阶段都通过复合奖励进行了优化,该复合奖励通过绝对和相对信号将答案准确性与预算效率结合起来,其中自适应权重放大了高精度查询的效率信号,并削弱了低精度查询的效率信号。对七个通用和多跳 QA 基准的广泛实验表明,我们的方法在所有预算规模上都优于基线,可推广到训练范围之外的看不见的约束,并在没有过多令牌开销的情况下实现卓越的工具生产力。我们的代码可在 https://github.com/xwsun01/AnySearch 获取。
