Soft Q-learning 已成为一种灵活的无模型熵正则化强化学习方法,通过对收益进行优化,并引入与参考策略的偏离惩罚。尽管其成功显著,软 Q-learning 的多步扩展仍然相对未被充分探索,且局限于在 Boltzmann 策略下的在线动作采样。
本文首先提出了软 Q-learning 的正式 $n$-步表述,随后通过引入新颖的 Soft Tree Backup 操作符将该框架扩展到完全的离策略情况。最后,我们将这些发展统一为 Soft $Q(\lambda)$,这是一种优雅的在线、离策略、资格迹框架,能够在任意行为策略下有效分配信用。
我们的推导提出了一种无模型的方法,用于学习熵正则化值函数,可用于未来的实证实验。
博主点评: 本文通过引入 Soft Tree Backup 操作符,显著扩展了传统软 Q-learning 的应用场景,为离策略学习提供了新的思路,尤其是在复杂环境中的信用分配问题上。