论文
ORBIT:在预算紧张的情况下为搜索代理生成可扩展且可验证的数据
ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget
摘要
将语言模型 (LM) 与网络搜索集成的搜索代理对于回答复杂的用户查询变得至关重要。由于昂贵的人工注释或繁琐的先决条件,为涉及多步骤检索和推理的深度研究任务构建训练数据集仍然具有挑战性。在这项工作中,我们介绍了 ORBIT,这是一个训练数据集,包含 20K 推理密集型查询和简短的可验证答案,使用节俭的框架生成,不依赖付费 API 服务。模块化框架依赖于四个阶段:种子创建、问答对生成以及两个验证阶段:自我验证和外部验证。 ORBIT 跨越 15 个领域,每个训练对需要 4-5 个推理步骤,并需要来自整个网络的外部搜索验证。我们使用 GRPO 在 ORBIT 上训练 Qwen3-4B 作为基础模型,并在维基百科问答任务上对其进行评估。大量的实验结果表明,ORBIT-4B 作为搜索代理在 sub-4B LLM 中实现了强大的性能,证明了合成数据集的实用性。我们的框架、代码和数据集都是开源的并且可供公开使用。