NeFut Logo NeFut
EN 管理员登录

[AI学术] 分解子任务的强化学习

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

Group Relative Policy Optimization(GRPO)等基于策略梯度的方法在更新策略前会把整个多轮 rollout 折叠为一个标量轨迹奖励。当任务由多个独立技能组成,且环境反馈稀疏且延迟时,这种折叠会导致信息丢失:优化器必须隐式推断是哪项能力导致了结果以及应如何调整行为。我们认为正确的原语不是更好的标量,而是对轨迹奖励进行分解:在进入策略更新前按子任务拆分奖励。

我们提出了分解子任务的强化学习(RLDS),其核心是 Subtask‑Decomposed Advantage Estimation(SDAE),它取代了标量 GRPO 优势函数。SDAE 将轨迹奖励按照固定的子任务分类拆分为子任务份额,针对每个子任务计算组相对优势,并通过对每个子任务重要性的加权,将优势分配到每个 token 上,重点集中在反射步骤标记该子任务执行为关键的时刻。

我们在四个具备代理特性的基准上进行评估:FrozenLake(稀疏网格导航)、HotpotQA(多跳问答,仅使用检索工具)、ScienceWorld(长时程具身科学)以及 DeepResearch(长篇研究,四种工具,复合评分标准)。训练期间的异质性诊断显示分解收益随子任务异质性增长,在高异质性任务上提升最大:ScienceWorld 提升 11.5 分(95% CI [+9.8, +13.3]),FrozenLake 提升 9.8 分([+7.0, +12.8]),而在 HotpotQA 与 DeepResearch 上收益在噪声范围内,诊断也预测了恢复有限。ScienceWorld 在 RLDS 下的计算效率更高,墙钟时间每步下降 10.9%,因为长 rollout 能摊销固定的反射与评分开销。

点评

原文链接: https://arxiv.org/abs/2609.27035

[h] 返回首页