在多轮 LLM 智能体的强化学习中,传统做法使用轨迹级奖励,对每一步赋予相同优势,难以辨别哪些决策导致成功或失败。自蒸馏方法通过引入特权信息提供更细粒度的监督,但多数方法对所有步骤使用同一种特权信息,忽视了步骤间的非对称性:常规步骤需求少,关键错误步骤则需要环境反馈无法提供的纠正指引。
AHEAD 提出了一种步感知框架,将不同监督源匹配到不同类型的步骤。教师模型在所有步骤上接收环境反馈形成稠密信号,并在错误步骤上额外获取 LLM 生成的纠正提示,以补足环境信息的缺失。该框架对标准 GRPO 算法的改动极小,仅在教师更新阶段加入条件性提示。
实验在 ALFWorld、WebShop 和基于搜索的问答任务上进行,覆盖 3 种模型规模。结果显示,AHEAD 在 7B 模型上相较于 GRPO 在 ALFWorld 上提升 13.3 分,在 WebShop 上提升 11.0 分;同时在更少的训练步数内达到相同成功率,并在更严格的交互预算下完成任务,优于仅使用结果的 RL 和已有的自蒸馏基线。
$$ R_t = \sum_{i=t}^{T} \gamma^{i-t} r_i $$
博主点评:AHEAD 通过区分常规与错误步骤的监督需求,实现了对 LLM 智能体的精准引导,展示了自蒸馏在强化学习中的新潜力。