GEO资讯

小红书开源Iris搜索智能体,深度检索可私有化

发布于 2026/9/18 85 次阅读
小红书开源Iris搜索智能体,深度检索可私有化

9月14日,搜索智能体权重开放

9月14日,小红书AllSpark研究团队正式开源搜索智能体模型Iris,模型权重与评测框架同步公开,配套技术报告《Iris: Climbing to the Search Frontier》已挂上arXiv。这不是一次普通的模型发布:此前的开源AI大模型大多围绕对话与写作,而Iris专攻"边搜、边读、边推理"的深度检索任务——模型要自己决定搜什么关键词、怎么读网页返回结果、证据够不够、什么时候收工作答。

对关注AI搜索引用的企业来说,这个方向值得留意。生成式引擎回答问题时的检索环节,正在从"调用通用模型"走向"专用搜索模型",谁能被检索到、被读到什么内容,工程细节正在变得透明。

两档模型,Apache协议开放

Iris分两档:Iris-mini总参数35B、激活3B,基于Qwen3.6-35B-A3B后训练;Iris-pro总参数397B、激活17B,基于Qwen3.5-397B-A17B后训练。两档均为混合专家架构,上下文窗口统一256K token,采用Apache-2.0协议,可商用。开源范围除了权重,还包括名为Iris-Harness的评测框架,覆盖完整的智能体搜索循环与四大基准评分器;训练数据与配方,团队表示将陆续公布。

成绩方面需要说明口径:官方公布的评测均为团队自报,第三方复测暂缺。在BrowseComp基准上,Iris-mini得82.2分、Iris-pro得88.6分;DeepSearchQA上pro拿到92.9分,HLE上56.4分。团队称两档模型在各自参数档位的开源模型中处于领先位置,35B档的成绩已接近部分更大的万亿参数级模型。这些数字看方向即可,落地前建议自行复测。

造题思路比分数更有参考价值

这项工作里更值得注意的是数据构造。搜索智能体的训练题很难出:网上的问答对早被模型背熟,闭卷也能答对,训练信号接近于零。AllSpark的做法是从网页超链接结构反向造题——先从种子页面顺出链聚出一张实体图谱,在图上编写必须跨多页推理才能作答的问题,再把题面中除答案之外的实体全部改写成描述性指代,让关键词匹配彻底失效。每道题还要过双重筛选:闭卷答不出(够难),喂入证据后能答对且答案单一(可解)。

训练上采用监督微调与强化学习交替的方案,判分和网页摘要模型都放在训练集群内部,不依赖外部API,网络波动被挡在训练循环之外。团队还观察到,专为搜索训练的能力会外溢到通用工具调用等任务——在信息不完整时决定"边做边找"的能力,并不只属于网页浏览。

企业视角:检索底座多了可选项

对需要搭建知识库问答、行业研报、深度调研工具的企业,Iris-mini这类35B级开源搜索模型提供了私有化部署的选项,敏感数据不必交给外部API。框架兼容OpenAI协议的后端,接入自有大模型即可复用其上下文管理策略,试错成本不高。

从GEO优化(生成式引擎优化)角度看,搜索智能体开源还有另一层含义:当检索环节的工程细节——如何搜、如何读、何时停——变得公开可复现,企业官网内容能不能被机器顺利读取和引用,就有了更明确的对标对象。结构清晰、事实完整、链接可达的页面,在这类模型的多跳检索中依然占优。

趋势:搜索能力走向可复用底座

过去一年,深度检索能力主要握在少数闭源产品手里。Iris把权重、评测框架和配方思路一起放出,方向上是在把搜索能力变成可复用、可二次开发的底座。可以预期,后续会有更多厂商沿这条路跟进,AI搜索引用的竞争会从"内容质量"延伸到"内容与检索工程的匹配度"。对企业来说,早一步把站点结构调整到机器友好,比追任何单个模型的发布都更实在。

信息来源