论文
循环一致搜索:以问题可重构性作为搜索智能体训练的代理奖励
Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training
摘要
强化学习(RL)在优化复杂信息检索任务中的搜索智能体方面展现出强大潜力。然而,现有方法主要依赖金标准监督(如真实答案),难以规模化。为解决这一局限,我们提出Cycle-Consistent Search(CCS),一个无需金标准监督的搜索智能体训练框架,其灵感来自无监督机器翻译与图像到图像翻译中的循环一致性技术。我们的核心假设是:最优搜索轨迹不同于不充分或无关的轨迹,它构成对问题意图的无损编码。因此,高质量轨迹应保留准确重构原始问题所需的信息,从而为策略优化诱导出奖励信号。然而,朴素的循环一致性目标容易受到信息泄露的影响,因为重构可能依赖表面词汇线索而非底层搜索过程。为减小这一影响,我们施加信息瓶颈,包括排除最终回答以及对搜索查询进行命名实体识别(NER)掩码。这些约束迫使重构依赖检索到的观察与结构骨架,确保所产生的奖励信号反映信息充分性而非语言冗余。在问答基准上的实验表明,CCS取得与有监督基线相当的性能,同时优于先前不依赖金标准监督的方法。这些结果表明,CCS为金标准监督不可用场景下的搜索智能体训练提供了可扩展的范式。
