论文
BRIDGE:感知双层检索信用的Agentic强化学习
BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning
摘要
Agentic 具有可验证奖励的强化学习 (ARL) 通过学习交错搜索和推理,提高了大语言模型 (LLM) 处理知识密集型任务的能力。然而,大多数现有的 ARL 方法仅优化 LLM 生成的标记,并将检索到的证据视为环境观察。这就造成了信息信用差距:由于证据缺失或误导而导致的失败被归咎于大语言模型政策而不是检索员,这促使大语言模型和检索员联合培训。在本文中,我们表明检索和 LLM 策略学习是顺序敏感的:在优化策略之前调整检索器会比相反顺序产生更大的奖励增益。为了保留这种层次结构,同时允许两个组件共同适应,我们将检索增强的 Agentic RL 制定为双层优化问题。为了有效地解决这个问题,我们引入了 BRIDGE,这是一种内存高效的一阶双层方法,其动机是对 RL 和检索目标进行损失景观分析。在七个开放域 QA 基准测试中,BRIDGE 在 3B 和 7B 主干上均实现了最高的平均准确度,与最强基线相比,多跳平均值分别提高了 9.6 和 3.4 EM 点。它还在医疗 QA 基准中实现了最佳平均答案准确性和推理质量。