NeFut Logo NeFut
EN 管理员登录

[AI学术] 依赖感知奖励塑形用于代理强化学习

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#AI #Graph #LLM

在大语言模型的强化学习训练中,仅有终局奖励难以指示哪些步骤关键。常用的步级信用分配方法忽视了已纠正错误的工作是浪费,而独立完成的工作仍然有效。若只给成功/失败的最终奖励,失败回合中的每一步的未来奖励为零,即使它们已经取得进展。

我们提出依赖感知奖励塑形(DARS),将任务进度抽象为带有前置关系的谓词,并在依赖图上分配步级信用。标注者为每一步标记验证、失效或修复的谓词。已验证的谓词根据与最近被破坏的前置谓词的图距离进行折扣,独立的谓词不受影响。修复操作会根据剩余错误更新权重,失效的谓词需要重新验证才能恢复信用。通过固定的势函数将这些标注转化为有符号的步级奖励。

统一的奖励和标注接口使 DARS 能够与 GiGPO、ARPO/AEPO 等推理和代理训练方法无缝集成,无需修改 rollout 策略或优化器。实验在五类任务和 1.5B~8B 参数模型上显示,DARS 在相同预算和 ALFWorld 环境下比 GiGPO 提升成功率最高 10 点,提升 WebShop 分数和 Search‑R1 QA 准确率,配合 AEPO 的熵基训练在 AIME24/25(带 Python 解释器)上取得增益,并在受控无工具推理比较中以 1.7B、4B 参数模型超越 OmniOPD。消融实验表明步级信用、依赖衰减和图拓扑各自都有贡献。在 ALFWorld 上,蒸馏的 8B 标注模型表现与 API 标注相当,使 DARS 能在无需前沿评判器的情况下高效运行。代码已开源。

点评:DARS 通过显式建模任务依赖,实现了更细粒度的奖励分配,显著提升了大模型的任务成功率和泛化能力。

原文链接: https://arxiv.org/abs/2610.01207

[h] 返回首页