论文
Iris:攀登搜索前沿
Iris: Climbing to the Search Frontier
摘要
我们提出了Iris-mini和Iris-pro两种搜索智能体,分别在35B-A3B和397B-A17B的规模上进行训练,配套提供了数据管道和训练方案。任务从网页语料的超链接结构逆向构建:基于种子页面及其出链构建多跳链路,将每个非答案实体重写为描述性引用,确保无法通过字符串匹配获取线索,仅保留参考模型在无外部信息时无法解答但提供证据后可解决的问题。这些问题被转化为轨迹,轨迹和每一步转换均在SFT前进行过滤。策略通过与实时搜索交互的强化学习进行优化,奖励判别器和观察摘要器部署在训练集群内,过长的轨迹在请求级别中断,并在下一次步骤从已提交的前缀恢复。我们采用一种称为SFT-RL爬升的交替流程,在每轮强化学习中返回最难解决且最高效的轨迹,用于下一轮监督训练。由于推理时上下文管理在这些基准中的作用显著,我们对每个基准均在启用和禁用上下文管理的情况下进行评估,保持工具集、上下文长度和判别器固定。所有结果均来自单一ReAct智能体,无子智能体,也无测试时验证。启用上下文管理后,在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE上,两个模型分别达到82.2/84.8/86.9/52.3和88.6/85.1/92.9/56.4的分数,成为各自参数规模范围内开源搜索智能体的最佳表现。我们计划同步发布模型权重及完整的数据构建、训练和评估流程。
