NeFut Logo NeFut
EN 管理员登录

[AI学术] 为什么要采样而不是枚举?基因组工具选择的精确策略优化

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#algorithm #AI #Machine Learning

强化学习在冻结的推理器上训练外部工具调用策略已成为常见做法。然而,在工具子集空间可枚举的专业科学场景中,这一做法出现结构性不匹配。此类场景只有少数可复用的计算能力,虽然工具子集的组合是组合性的,但规模足够小以致可以全部枚举。GRPO(Group‑Normalized Policy Optimization)仍然只从少量采样的 rollout 中估计动作期望,导致近似误差随训练进展而加剧。随着策略逐渐集中在少数首选子集上,采样的奖励会相互冲突,组归一化优势趋于消失。实验中,在基因组推理任务上,使用均匀参考策略时无奖励的提问比例为 0.2%,而经过 GRPO 训练后升至 20.8%。为了解决这一问题,本文提出 FGPO(Full‑Group Policy Optimization),其核心有两点:

  1. 对每个工具子集进行打分并优化精确的动作期望,使每次更新都能看到完整的动作空间;
  2. 将每个问题‑子集对的奖励预先计算并存入完整表格,训练循环中不再调用冻结的推理器。实验在五个冻结推理器和三个基因组基准上进行,FGPO 在全部 15 种设置中平均提升 6.75 分,最高提升 14.20 分。相比之下,标准的按需 GRPO 需要 2.4 倍的冻结推理器奖励评估次数;在 GenomeQA 基准上,FGPO 将每题调用的工具数从 2.36 降至 1.40。

点评:FGPO 通过全枚举与预计算奖励实现了策略优化的精确性,显著提升了基因组推理的效率和效果,展示了在可枚举工具空间中摒弃采样的潜在价值。

原文链接: https://arxiv.org/abs/2609.10221

[h] 返回首页