模型

小红书 AllSpark 发布开源 Search Agent Iris:35B ,397B 部分基准反超

小红书 AllSpark 发布 Iris:同量级最强开源 Search Agent

应用与实践模型训练上下文与知识智能体系统AI 基础设施强化学习上下文工程检索增强Agent 工具调用模型部署搜索Agentic RL

概述

Iris 是面向真实网络边搜边读边推理、自主决定何时收敛作答的 Search Agent,权重与评测代码已开源。数据侧,训练题从网页超链接结构反向构造:以种子页面为答案顺出链聚成小型实体图谱、编写需跨多页多步推理才能得到唯一答案的问题,再把题面除答案外的每个实体改写为描述性指代以杜绝关键词匹配,最后用参考模型双重筛选(闭卷答不出且给证据上下文能答对且答案唯一)的题目才保留,全流程自动、不依赖人工出题。训练侧采用 SFT–RL Climbing:SFT 阶段用强教师模型在真实搜索工具上产出轨迹,经轨迹层与单轮“判官”两层过滤;RL 阶段把判分与摘要都收进训练集群内部(自建模型同时充当奖励判官与检索内容摘要器,全程不依赖外部 API),并对超长轨迹做请求级“断点续跑”,每轮 RL 后把最难做对与最高效解出的轨迹回灌下一轮 SFT。评测侧在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 四个基准上、相同 Tool/Context/Judge Model 与单 ReAct 智能体设置下比较:Iris-mini(35B)成绩 82.2 / 84.8 / 86.9 / 52.3,BrowseComp 上 82.2 分逼近 Kimi-K2.6 等万亿参数级模型;Iris-pro(397B)成绩 88.6 / 85.1 / 92.9 / 56.4,在 BrowseComp、DeepSearchQA、HLE 上为同量级最强开源,BrowseComp-ZH 并列第一。上下文管理对照实验显示,即便不开 CM 也领先同量级系统,开启后小模型获益更大。团队还观察到为 Search 合成的数据与专家模型在未见过的 General Tool Use(BFCL、τ-bench)与 Cowork(OfficeQA、APEX)场景同样有效。 团队给出 Iris 的官方项目入口 GitHub https://github.com/AllSpark-Research/Iris 与 HuggingFace 权重合集 https://huggingface.co/collections/AllSpark-Research/iris,宣称公开模型权重、评测代码,并将陆续公布数据构造、训练、评测各环节的关键组件与完整配方。正文对开源范围的表述存在不一致:导读称“权重和评测代码已开源,并将陆续公布数据与训练的完整配方”,文末则称“团队计划开源模型权重,以及数据构造、训练、评测各环节的关键组件”,故本条开源范围标为待核。