NeFut Logo NeFut
EN 管理员登录

[AI学术] 软Q学习的突破:多步离策略熵正则化方法

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Reinforcement Learning

Soft Q-learning 已成为一种灵活的无模型熵正则化强化学习方法,通过对收益进行优化,并引入与参考策略的偏离惩罚。尽管其成功显著,软 Q-learning 的多步扩展仍然相对未被充分探索,且局限于在 Boltzmann 策略下的在线动作采样。

本文首先提出了软 Q-learning 的正式 $n$-步表述,随后通过引入新颖的 Soft Tree Backup 操作符将该框架扩展到完全的离策略情况。最后,我们将这些发展统一为 Soft $Q(\lambda)$,这是一种优雅的在线、离策略、资格迹框架,能够在任意行为策略下有效分配信用。

我们的推导提出了一种无模型的方法,用于学习熵正则化值函数,可用于未来的实证实验。

博主点评: 本文通过引入 Soft Tree Backup 操作符,显著扩展了传统软 Q-learning 的应用场景,为离策略学习提供了新的思路,尤其是在复杂环境中的信用分配问题上。

原文链接: https://arxiv.org/abs/2604.13780

[h] 返回首页