觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-09-13 2 浏览 免费阅读

Iris-mini 与 Iris-pro 是同级别最强的开放权重搜索智能体

中国实验室 AllSpark 发布 Iris-mini 和 Iris-pro 两个开源搜索智能体,参数规模分别为 350 亿和 3970 亿,基于 Qwen 系列模型,配套完整训练配方。论文称其在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity's Last Exam 上取得同规模开放权重搜索智能体中的最强结果,并强调运行时上下文管理对基准表现影响很大。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-13 20:58:18

原贴

查看原文
作者:Jonathan Kemper 来源站点:the-decoder.com 原贴时间:

原文

The AllSpark team has released Iris-mini and Iris-pro, two open-source search agents along with a full training recipe. According to the paper, the training data and models also improved performance on tasks they were never trained for, including general tool use and office work. Search agents built on language models research the web on their own. They need to understand the question, decide what to search for, interpret the results, and judge when they've gathered enough evidence for an answer. How much of that the models actually do is debated. On established benchmarks, leading AI systems of this kind mostly use the web to confirm knowledge they already picked up during training . In a new paper, Chinese lab AllSpark describes two search agents of different sizes. Iris-mini has 35 billion parameters, and Iris-pro has 397 billion. Both build on Qwen-series models ( Qwen3.6-35B-A3B and Qwen3.5-397B-A17B ), work with a 256,000-token context window, and deliver the strongest results among open-weight search agents in their respective size class, according to the team. The training pipeline builds tasks backward from the link structure of web pages. Starting from a seed page and its outgoing links, it constructs a graph of terms and relationships. From that graph, it generates a multi-step question whose answer requires chaining several connected steps together. Every term except the final answer gets replaced with a paraphrase, so no clue can be resolved through a simple text search. The agent has to reason, not just look things up. Only questions that a reference model can't solve without tools but can solve with the right sources make it into the dataset. That keeps the tasks both hard and clearly verifiable. A stronger teacher model generates solution paths made up of reasoning, search queries, and results. These paths go through two rounds of filtering. The first checks the full path for correctness, repetition loops, and search depth. The second is a step-by-step review by a judge model whose criteria were derived from the data itself rather than set by hand, according to the paper. After that, the model is improved through reinforcement learning against a live web search. The judge model and result summaries run inside the training cluster, powered by the team's own large Qwen model so training doesn't depend on external services. Supervised fine-tuning and reinforcement learning alternate in a process the authors call "SFT-RL climbing." The hardest solved tasks and the most efficient solution paths from each round feed back into the next training cycle. The team argues that runtime context management on common benchmarks often makes a bigger difference than the reported gaps between systems. During long research sessions, the context can fill up before the agent has resolved all sub-questions. Tricks like discarding the conversation history extend the research artificially but say little about the model's actual quality. To isolate the effect, the team tests every benchmark with and without context management while keeping tools, context limits, and the judge model constant. Results reported only with management turned on can't be cleanly split into what comes from the model and what comes from the scaffolding around it. The Iris scores also come from a single agent, with no helper agents and no extra verification steps at the end. Testing covered BrowseComp, which tests the ability to find rare facts from indirect clues, its Chinese counterpart BrowseComp-ZH, DeepSearchQA, which evaluates the completeness of retrieved evidence, and Humanity's Last Exam , which poses academic questions at expert level. With context management turned on, Iris-mini scores 82.2, 84.8, 86.9, and 52.3 according to the paper. Iris-pro reaches 88.6, 85.1, 92.9, and 56.4. In the smaller class, Iris-mini leads on three of four benchmarks and beats the next-best model, XYZ-Aquila-mini, on BrowseComp by 3.4 points, though it trails on De

中文翻译

AllSpark 团队发布了 Iris-mini 和 Iris-pro,两个开源搜索智能体,以及一套完整的训练配方。

根据论文,训练数据和模型还提升了它们从未被训练过的任务的表现,包括通用工具使用和办公工作。

建立在语言模型之上的搜索智能体自行研究网络。

它们需要理解问题,决定搜索什么,解释结果,并判断何时已收集到足够证据来给出答案。

模型实际上做了其中多少仍有争议。

在既定基准上,这类领先的 AI 系统大多使用网络来确认它们在训练期间已经获得的知识。

在一篇新论文中,中国实验室 AllSpark 描述了两种不同规模的搜索智能体。

Iris-mini 有 350 亿参数,Iris-pro 有 3970 亿参数。

两者都建立在 Qwen 系列模型(Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B)之上,使用 256,000 个 token 的上下文窗口,并且根据该团队的说法,在各自规模级别的开放权重搜索智能体中提供了最强结果。

训练流程从网页的链接结构反向构建任务。

从一个种子页面及其出站链接开始,它构建一个术语和关系的图。

从该图中,它生成一个多步问题,其答案需要将几个相互连接的步骤串联起来。

除最终答案外的每个术语都被替换为同义转述,因此没有任何线索可以通过简单的文本搜索解决。

智能体必须推理,而不仅仅是查找。

只有参考模型在没有工具时无法解决、但在有正确来源时能够解决的问题才会进入数据集。

这使任务既困难又清晰可验证。

一个更强的教师模型生成由推理、搜索查询和结果组成的解决路径。

这些路径经过两轮过滤。

第一轮检查完整路径的正确性、重复循环和搜索深度。

根据论文,第二轮是由一个评判模型进行逐步审查,其标准来自数据本身,而不是手工设定。

之后,模型通过针对实时网络搜索的强化学习得到改进。

评判模型和结果摘要运行在训练集群内部,由该团队自己的大型 Qwen 模型驱动,因此训练不依赖外部服务。

监督微调和强化学习在一个作者称为“SFT-RL 攀登”的过程中交替进行。

每一轮中最难的已解决任务和最高效的解决路径会反馈到下一训练周期。

该团队认为,在常见基准上,运行时上下文管理往往比系统之间报告出的差距产生更大影响。

在长时间研究会话中,上下文可能在智能体解决所有子问题之前就被填满。

像丢弃对话历史这样的技巧会人为延长研究,但对模型实际质量说明很少。

为了分离这种影响,该团队在保持工具、上下文限制和评判模型不变的情况下,对每个基准都测试了有和没有上下文管理的情况。

只在开启管理时报告的结果无法干净地拆分为哪些来自模型、哪些来自其周围的脚手架。

Iris 的分数也来自单个智能体,没有辅助智能体,也没有最后的额外验证步骤。

测试覆盖了 BrowseComp,它测试从间接线索中发现稀有事实的能力;其中文对应基准 BrowseComp-ZH;DeepSearchQA,它评估检索证据的完整性;以及 Humanity's Last Exam,它提出专家级别的学术问题。

根据论文,在开启上下文管理的情况下,Iris-mini 得分分别为 82.2、84.8、86.9 和 52.3。

Iris-pro 达到 88.6、85.1、92.9 和 56.4。

在较小规模类别中,Iris-mini 在四个基准中的三个上领先,并在 BrowseComp 上以 3.4 分的优势击败次优模型 XYZ-Aquila-mini,不过它在 De 上落后。

核心信息

中国实验室 AllSpark 发布 Iris-mini 和 Iris-pro 两个开源搜索智能体,参数规模分别为 350 亿和 3970 亿,基于 Qwen 系列模型,配套完整训练配方。论文称其在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity's Last Exam 上取得同规模开放权重搜索智能体中的最强结果,并强调运行时上下文管理对基准表现影响很大。

  • 中国实验室 AllSpark 发布 Iris-mini 和 Iris-pro 两个开源搜索智能体,参数规模分别为 350 亿和 3970 亿,基于 Qwen 系列模型,配套完整训练配方。论文称其在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity's Last Exam 上取得同规模开放权重搜索智能体中的最强结果,并强调运行时上下文管理对基准表现影响很大。
  • 原贴提到:The AllSpark team has released Iris-mini and Iris-pro, two open-source s
  • 来源:the-decoder.com

详细解读

这是什么信号

AllSpark 发布的 Iris-mini 和 Iris-pro 不是普通模型更新,而是把“搜索智能体”的核心训练方法、数据构造方式和评测口径一起公开。Iris-mini 为 350 亿参数,Iris-pro 为 3970 亿参数,均基于 Qwen 系列,支持 256,000 token 上下文,团队声称在各自规模级别的开放权重搜索智能体中结果最强。更关键的信号是:训练流程从网页链接结构反向生成多步问题,除最终答案外全部改写,迫使模型必须推理和串联证据,而不是靠简单检索确认已有知识。

论文还强调,常见基准上的运行时上下文管理往往比系统之间报告出的分数差距影响更大。只在开启上下文管理时报告结果,无法干净区分模型能力与外部脚手架能力。这意味着搜索智能体的竞争正在从“模型多大”转向“训练数据、强化学习环境、上下文管理和评测透明度”的系统竞争。

为什么重要

搜索智能体是让大模型真正使用互联网、降低幻觉、完成深度研究任务的关键形态。过去很多领先系统在既定基准上主要是用网络确认训练中已经获得的知识,而 Iris 的训练管线试图让模型必须通过多步推理和实时搜索才能得到答案。若论文结论可复现,它提供了一条可复制的路径:用网页链接图生成困难且可验证的任务,用教师模型生成解决路径,再用两轮过滤和实时网页 RL 提升模型。

同时,团队对评测方法的批评很有价值。上下文管理、工具设置、上下文限制和评判模型若不一致,分数就难以比较。Iris 的分数来自单智能体、无辅助智能体、无额外验证步骤,这至少在口径上更干净。对开源生态来说,这提高了开放权重搜索智能体的竞争门槛,也让企业团队可以在不依赖闭源 API 的情况下评估自建深度研究能力。

对谁有价值

对 AI 研究者,这是一份关于搜索智能体数据合成、SFT-RL 交替训练和评判模型设计的完整案例。对 agent 开发者,Iris 的“从链接结构反向造题”和“评测时控制上下文管理变量”可以直接借鉴。对企业 AI 团队,它意味着可以用开放权重模型搭建垂直领域的深度搜索、竞品研究、合规检索和办公自动化智能体,而不必完全依赖外部服务。对投资人和产品负责人,它提示搜索智能体的价值不只在模型参数,而在训练配方、评测可信度和工程化上下文管理。

可以怎么行动

第一,跟踪 AllSpark 论文和模型权重,重点验证训练配方是否可复现,以及 Iris-mini 和 Iris-pro 在自有业务数据上的表现。第二,在自建搜索智能体时,不要只堆模型,先把任务生成、数据过滤、实时搜索 RL 和上下文管理作为一等模块。第三,评测时同时跑“开上下文管理”和“关上下文管理”两组,报告模型与脚手架各自的贡献。第四,关注单智能体无额外验证的设置,因为这与真实产品中是否加验证层、加辅助智能体是不同问题。第五,结合自身领域链接结构或知识图谱,构造多步可验证问题,训练垂直搜索智能体。

风险或限制

首先,原文在最后一句被截断,Iris-mini 在较小规模类别中“在 De 上落后”的完整结论无法确认,不能据此判断全部基准表现。其次,论文和团队声称的最强结果需要独立复现,基准分数也高度依赖上下文管理、工具设置和评判模型。再次,Iris 分数来自单智能体、无辅助智能体和末尾额外验证,实际产品若加入这些组件,效果与成本会变化。第四,基于实时网页搜索的强化学习可能带来数据污染、版权、安全和稳定性问题,训练集群内跑评判模型也意味着较高工程门槛。最后,开放权重不等于低门槛部署,3970 亿参数模型仍需要可观算力,350 亿参数版本也未必适合所有边缘场景。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Iris-mini 与 Iris-pro 是同级别最强的开放权重搜索智能体》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

Iris-mini 与 Iris-pro 是同级别最强的开放权重搜索智能体主要讲什么?

中国实验室 AllSpark 发布 Iris-mini 和 Iris-pro 两个开源搜索智能体,参数规模分别为 350 亿和 3970 亿,基于 Qwen 系列模型,配套完整训练配方。论文称其在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity's Last Exam 上取得同规模开放权重搜索智能体中的最强…

这篇文章最值得关注的要点是什么?

中国实验室 AllSpark 发布 Iris-mini 和 Iris-pro 两个开源搜索智能体,参数规模分别为 350 亿和 3970 亿,基于 Qwen 系列模型,配套完整训练配方。论文称其在 BrowseComp、BrowseCom…;原贴提到:The AllSpark team has released Iris-mini and Iris-pro, two open-source s;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI副业、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、智能体」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 ElevenLabs 通过应用和 API 提供 Music v2.5,含免费与 Pro 套餐选项 下一篇 GPT-6 Astra 自主驾驶监控无人机并独立经营业务