论文
LexiHorizon:稳定强化学习以实现长视野深度搜索
LexiHorizon: Stabilizing Reinforcement Learning for Long-Horizon Deep Search
摘要
深度搜索智能体通过迭代检索、多跳推理和跨多个来源的证据合成来解决复杂的知识任务。现有方法通常假设相对稳定的检索系统并在短视野工具交互上运行。然而,当检索对查询表述敏感时,即使语义上适当的查询也可能因实体名称、别名或关键字组合不匹配而无法显示关键证据。从此类故障中恢复需要重复的查询重新制定和更长的交互轨迹。此设置对训练提出了独特的挑战,因为策略必须维持长期查询探索,同时管理不断扩大的检索内容量。我们提出了 LexiHorizon,一个用于训练长期搜索智能体的框架,它扩展了轨迹上下文预算,使用最近工具观察的窗口管理累积的检索内容,同时保留推理历史,并引入了结果门控的搜索努力奖励,为具有非零答案奖励的轨迹的工具调用提供有限的奖励。 XBench、WebWalkerQA 和 BrowseComp-ZH 上的实验表明,生成的 9B 模型始终优于其基础模型和 MiroThinker-1.7-mini,最大绝对增益分别为 8.7 和 23.8 个百分点。这些结果表明,将扩展的上下文预算与保留推理的上下文管理相结合有利于长期深度搜索智能体。