论文
REDSearcher:面向长视界搜索智能体的可扩展且高性价比框架
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
摘要
大语言模型正从通用知识引擎转变为现实世界问题求解器,但针对深度搜索任务对其进行优化仍然充满挑战。核心瓶颈在于高质量搜索轨迹与奖励信号的极度稀疏,其根源是可扩展长视界任务构建的困难,以及涉及外部工具调用的高交互成本 rollout。为应对这些挑战,我们提出 REDSearcher,一个协同设计复杂任务合成、中期训练(mid-training)与训练后优化的统一框架,以实现可扩展的搜索智能体优化。具体而言,REDSearcher 引入以下改进:(1) 将任务合成表述为双重约束优化,任务难度由图拓扑与证据分散度精确控制,从而可扩展地生成复杂、高质量任务;(2) 引入工具增强查询,鼓励主动使用工具而非被动回忆;(3) 在中期训练中强化知识、规划与函数调用等核心原子能力,大幅降低下游训练收集高质量轨迹的成本;(4) 构建本地模拟环境,支持强化学习实验的快速、低成本算法迭代。在纯文本与多模态搜索智能体基准上,该方法均取得最优性能。为促进长视界搜索智能体的未来研究,我们将发布 10K 高质量复杂文本搜索轨迹、5K 多模态轨迹和 1K 文本 RL 查询集,并附带代码与模型检查点。
