论文
Harness-G:用于搜索代理的图结构 Harness
Harness-G: A Graph-Structured Harness for Search Agents
摘要
强化学习 (RL) 搜索代理通常将检索建模为自由形式的自然语言查询生成,并使用最终答案奖励优化多轮交互。目前的研究主要通过更密集或更结构化的信用信号来改进训练,但很少检查检索是否在政策-环境界面上得到了正确的制定。我们在 Search-R1 训练期间观察到明显的检索别名:同一问题的采样轨迹继续生成不同的查询字符串,但它们积累的证据集越来越重叠。我们称这种现象为检索-等价崩溃;在这种情况下,轨迹在检索决策方面接近效用等价,使得组内返回几乎没有有效的检索对比。为了解决这个问题,我们提出了 Harness-G,一个重新设计了这个界面的图结构检索框架。它将自由格式查询生成重新表述为有限动作选择:策略选择证据句子或实体,或者选择答案,而环境构建菜单,跟踪检索状态,并验证和执行每个选择。该接口减少了语言别名,并使相同状态的替代方案可以直接进行比较。在此界面的基础上,我们引入了结构化非近视信用(SNC),它使用冻结答案评分器将所选操作与其替代方案进行比较,并将下游收益分配给启用它们的早期操作。在六个 QA 基准测试中,Harness-G 在两个评估模型尺度上均实现了最高的平均 F1,在 1.5B 和 3B 方面均优于最强基线 Graph-R1 10.74 分和 3.98 分。