NeFut Logo NeFut
EN 管理员登录

[AI学术] Iris:迈向搜索前沿

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#AI #Graph #Open Source

我们推出了 Iris-mini 与 Iris-pro 两个搜索代理,分别在 35B‑A3B 与 397B‑A17B 规模下进行训练,并公开了背后的数据管线与训练配方。任务从网页语料的超链接结构逆向构造:先在种子页面及其外链中提取实体图,生成多跳链路;随后将每个非答案实体改写为描述性引用,确保无法通过字符串匹配直接得到线索;仅保留参考模型在闭卷条件下失败、但在提供支持证据后能够解答的问题。这些问题被转化为轨迹,在轨迹层和回合层均进行过滤后进入监督微调(SFT)。

策略随后通过强化学习(RL)在实时搜索环境中进行优化,奖励评判器与观察摘要器部署在训练集群内部,超长回合在请求层被截断并在下一步从已提交的前缀恢复。我们交替进行 SFT 与 RL,称为 SFT‑RL climbing,将每轮 RL 中最难解且最高效的回合返回给下一轮监督微调。

因为在这些基准上推理时的上下文管理价值高于大多数系统报告的差异,我们在保持工具集、上下文上限和评判器不变的前提下,分别在有无上下文管理的情况下评估所有基准。所有结果均来自单一 ReAct 代理,没有子代理,也不进行测试时验证。开启管理后,在 BrowseComp、BrowseComp‑ZH、DeepSearchQA 与 HLE 四个基准上,两模型分别取得 $82.2/84.8/86.9/52.3$ 与 $88.6/85.1/92.9/56.4$ 的分数,成为各自参数区间内开源搜索代理的最强表现。我们计划同步发布模型权重以及完整的数据构建、训练与评估配方。

点评:Iris 系列通过逆向任务构造、严格的轨迹过滤以及 SFT‑RL 交替优化,实现了在多语言搜索基准上的显著突破,尤其是上下文管理的系统性评估为后续研究提供了重要参考。

原文链接: https://arxiv.org/abs/2609.04304

[h] 返回首页