论文

RICE-PO:将检索交互转化为推理代理的信用信号

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

模型训练强化学习

摘要

检索正逐渐从一次性匹配转向交互式推理,即语言代理迭代地检查证据、重新制定查询并再次搜索。训练此类代理提出了贡献分配挑战:检索器 可以直接评估可执行操作(例如查询或摘要),而潜在推理步骤不能直接观察到,只会影响未来的可执行操作。这种不对称性使得结果级别的奖励分配不可靠,因为相同的最终奖励可能会归功于实际上并没有影响检索成功的推理步骤。我们提出了 RICE-PO,一种无批评的策略优化框架,可将检索交互转换为本地化学习信号。 RICE-PO选择高不确定性的可执行动作作为锚点,使用检索指标评估局部反事实分支,并且仅当推理对动作的影响很强并且未来的残余效应稳定时才将信用传播到潜在的推理步骤。在 BRIGHT 和 BEIR 上,在相同的 检索器 设置下,RICE-PO 始终优于基于提示的代理和基于组的 RL 基线。这些结果表明,智能体与环境交互的结构本身可以为训练基于推理的检索智能体提供有用的监督。