NeFut Logo NeFut
EN 管理员登录

[AI学术] AHEAD:自适应后视与环境增强蒸馏用于智能体强化学习

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

在多轮 LLM 智能体的强化学习中,传统做法使用轨迹级奖励,对每一步赋予相同优势,难以辨别哪些决策导致成功或失败。自蒸馏方法通过引入特权信息提供更细粒度的监督,但多数方法对所有步骤使用同一种特权信息,忽视了步骤间的非对称性:常规步骤需求少,关键错误步骤则需要环境反馈无法提供的纠正指引。

AHEAD 提出了一种步感知框架,将不同监督源匹配到不同类型的步骤。教师模型在所有步骤上接收环境反馈形成稠密信号,并在错误步骤上额外获取 LLM 生成的纠正提示,以补足环境信息的缺失。该框架对标准 GRPO 算法的改动极小,仅在教师更新阶段加入条件性提示。

实验在 ALFWorld、WebShop 和基于搜索的问答任务上进行,覆盖 3 种模型规模。结果显示,AHEAD 在 7B 模型上相较于 GRPO 在 ALFWorld 上提升 13.3 分,在 WebShop 上提升 11.0 分;同时在更少的训练步数内达到相同成功率,并在更严格的交互预算下完成任务,优于仅使用结果的 RL 和已有的自蒸馏基线。

$$ R_t = \sum_{i=t}^{T} \gamma^{i-t} r_i $$

博主点评:AHEAD 通过区分常规与错误步骤的监督需求,实现了对 LLM 智能体的精准引导,展示了自蒸馏在强化学习中的新潜力。

原文链接: https://arxiv.org/abs/2608.24114

[h] 返回首页