💡 一句话总结:小红书 AllSpark 团队把两个搜索智能体(35B 和 397B)连权重带评测代码按 Apache 2.0 开源,四个搜索基准上同参数档开源最强(成绩为团队自报,第三方复测暂缺)。比起跑分,更值得开发者关注的是它的数据构造思路——把「模型靠背答案蒙对」的路彻底堵死,以及论文里那句实话:推理时的上下文管理,比大多数系统之间报告的性能差距还值钱。

导语:搜索智能体这个行当,最怕的不是模型不行,是考题泄了

做一个能自主上网搜资料的 AI agent,最头疼的环节往往不是模型——是训练数据。想让模型学会「边搜、边读、边推理、自己决定什么时候收工」,你得先有够难、又确实可解的题目。难在哪?网上流传的问答对早就被模型背烂了:你考它「某公司哪年成立」,它闭卷都能答对,训练信号等于零。

这就是所谓的数据污染:考题泄了,分数虚高。9 月初挂上 arXiv、随后开源的小红书 AllSpark 团队 Iris(论文《Iris: Climbing to the Search Frontier》),核心卖点恰恰是把这条造假之路堵死的数据构造方法。顺带一提,权重是真能下的:Hugging Face 上 Iris-mini 和 Iris-pro 都是 Apache 2.0 协议,评测 harness 也一并放出了。

一手与关键信源

两个模型什么来头:一个能单卡想,一个用来刷榜

先交代规格,两兄弟都是 MoE 架构(混合专家:总参数量大,但每个词只激活一小部分参数上场,推理成本低):

  • Iris-mini:从 Qwen3.6-35B-A3B 后训练而来,总参数 350 亿、激活仅 30 亿,256K 上下文。激活 3B 意味着部署门槛相当友好。
  • Iris-pro:基座 Qwen3.5-397B-A17B,总参数 3970 亿、激活 170 亿,这个体量就是奔着刷榜去的。

成绩上(按开启推理时上下文管理的口径):BrowseComp 82.2 / 88.6,BrowseComp-ZH 84.8 / 85.1,DeepSearchQA(F1)86.9 / 92.9,HLE 52.3 / 56.4。官方口径是两个模型均取得同参数档开源搜索智能体最强成绩,35B 档已「逼近万亿参数级模型」。

这里需要澄清的是:「同量级最强」是和同参数档的开源模型比,不等于超过闭源前沿;所有数字均为团队自报,目前没看到第三方榜单或独立复测(uncertain)。cocoloop 的标题概括得很到位——「上下文管理胜过堆参数」,这也是论文里最有含金量的一句话。

数据怎么造:从超链接里反向出题,让背题党全部失效

Iris 数据管线的思路值得展开讲讲,因为它绕开了「人工出题」和「网上收题」两条老路,直接从网络结构里反向构造:

  • 从一个种子页面和它的外链里提炼实体图,沿着实体链编写多跳问题——答案需要跳好几个页面才能拼出来。
  • 关键一步:把问题里所有非答案实体改写成描述性指代。比如不问「A 公司的创始人 X」,而是问「那位提出某某方法、曾在某实验室任职的研究者」。这样字符串匹配彻底失效——模型没法靠检索关键词碰巧命中答案,必须真的理解语义去搜。
  • 两道过滤闸门:只保留「闭卷答不出、给了证据能答对」的题目;先在轨迹层过滤(正确性、简并性、搜索深度),再在回合层用一套「从数据里归纳出来、而非人工编写的评分准则」过滤,然后才进 SFT。

评估:这套方法的可迁移性可能是它最大的价值——反向构造的思路不只能造搜索题,做工具调用、代码 agent 的训练数据合成,逻辑是通的。等官方把数据和配方「陆续公布」,值得对着复刻一遍。

训练怎么跑:SFT 和 RL 交替「攀升」,长回放可以断点续传

Iris 的训练是一个交替循环,论文起了个形象的名字「SFT–RL 攀升(climb)」:监督微调(SFT)和真实搜索环境里的强化学习(RL)轮流来,每一轮 RL 里最难解决且最高效的回放,会被回喂给下一轮监督训练——相当于把最值钱的错题整理进下一版教材。

工程上还有两个细节很实在:

  • 奖励评判器和观察摘要器直接跑在训练集群内,省去了跨集群通信的开销。
  • 过长的 RL 回放会在请求级别被中断,下一步从「已提交的前缀」恢复——搜索智能体的轨迹动辄几百轮工具调用,没有断点续传机制,算力浪费会非常可观。

另外那个「上下文管理」到底指什么?简单说就是 agent 怎么管理自己越滚越长的搜索记录:哪些证据保留原文、哪些压缩成摘要、什么时候丢弃。论文的原话是:推理时上下文管理的价值,「超过大多数系统间报告的差异」——翻译一下,同一个模型换个上下文策略,成绩波动比你换一个基座模型还大。这也解释了为什么 Iris 的成绩要按开启/关闭两套口径报告。

对你意味着什么:35B 档的搜索 agent 首次「可自部署」

把话说明白。对做搜索、RAG(检索增强生成)和 agent 应用的开发者,Iris-mini 是这次发布里最实际的东西:激活 3B 的搜索智能体,意味着中等规模的显卡配置就有机会自己部署一套「会搜会读会收敛」的 agent,而不是只能调 API。能力外溢到多场景是官方说法,具体清单没给(uncertain),上手前建议先跑官方 harness 复现基准。

几个该留意的坑也摆在这里:成绩未经过第三方验证;「数据与训练配方陆续公布」没有时间表,开源完整性要等后续发布才能下结论;基座依赖 Qwen 系,能力上限部分 inherited 自基座;推理成本数据未公布,部署前自己压测。

往行业脉络里放:2026 年搜索智能体正在从「框架编排」(用提示词把搜索工具串起来)转向「端到端训练」(为搜索行为本身专项训练模型),Iris 是这个转向里第一个同量级开源标杆。在小红书自家棋盘上,它和主打长程任务的 dots3-note 也是互补的两条线。跑分数字过几个月就会过时,但这套「堵死背题路」的数据构造法,大概会用得比模型本身久。


参考来源

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐