论文

PaperScout:基于过程感知序列级策略优化的学术论文检索自主智能体

PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy Optimization

模型训练强化学习Agentic RL

摘要

学术论文搜索是科学研究的一项基本任务,但大多数现有方法都依赖于严格的、预定义的工作流程,难以应对复杂的条件查询。为了解决这个限制,我们提出了 PaperScout,这是一个自主代理,它将论文搜索重新表述为一个连续的决策过程。与静态工作流程不同,PaperScout 根据累积的检索上下文动态决定是否、何时以及如何调用搜索和扩展工具。然而,训练此类代理提出了一个根本性的挑战:通常为单轮任务设计的标准强化学习方法在应用于多轮代理任务时会遇到粒度不匹配的问题,其中token级优化与序列级交互的粒度不同,从而导致嘈杂的贡献归因。我们引入了近端序列策略优化(PSPO),这是一种流程感知的序列级策略优化方法,可将优化与代理环境交互相结合。对合成基准和现实基准的综合实验表明,PaperScout 在召回率和相关性方面显着优于强大的工作流程驱动和 RL 基准,验证了我们的自适应代理框架和优化策略的有效性。

PaperScout:基于过程感知序列级策略优化的学术论文检索自主智能体
图1:不同学术搜索范式的比较:Semantic Match(语义匹配)、Fixed Workflow(固定工作流)与 Agentic Search(智能体搜索)。