论文
G-ReAct:通过结构状态协同演化实现图引导深度搜索
G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution
摘要
深度搜索已成为大语言模型(LLMs)解决开放域复杂任务的基础能力。然而,现有的方法通常依赖于线性序列推理,用于生成轨迹和推理,这使得在长跨度多跳搜索过程中始终保留在中间状态和约束方面变得困难。因此,它们经常遭受上下文遗忘、搜索退化和不充分的探索等问题。为了解决这些问题,我们提出了一种名为$\textbf{G-ReAct}$的推理框架,该框架将推理组织为$\textbf{状态演变在固定的拓扑查询图上}$。不断变化的图状态明确跟踪搜索进展,并引导后续决策,将基于文本历史的探索驱动的推理转化为在明确约束下的图引导推理。G-ReAct支持训练和推理:它生成高质量的深度搜索轨迹进行监督微调,并为推理时间提供结构化的指导,无需额外的微调。实验结果表明,仅使用1.9K生成的轨迹进行微调,Qwen3-30B-A3B-Thinking-2507在BrowseComp-ZH上达到52.6%的准确率,在XBench上达到79.0%,超过了使用大规模数据集训练的相似开源方法,包括强化学习增强的方法。此外,当应用于推理时间时,G-ReAct在深度搜索任务上持续改善现有强LLMs的表现。我们将公开所有代码和模型权重。
