量化分位强化学习通过优化累计回报分布的指定分位,实现对风险敏感的可解释决策。单点分位目标虽直观,却难以学习:分位在返回分布的微小扰动下会剧烈跳变,且精确的分位规划需要高成本的分布式优化。下缓冲分位通过对目标分位以下相邻分位取平均,得到平滑的替代目标,同时仍保留点分位的本质。已有方法基于该思想,但仍是模型化的,需要显式的返回律规划,难以推广到大规模或连续状态空间。我们提出 Deep‑BQRL,一个无模型的分布式强化学习框架,将缓冲分位学习扩展到神经网络函数逼近。该方法直接从采样转移中学习条件返回分位,利用学习到的分位函数在目标分位附近构造缓冲动作评分,并用集合不一致性驱动探索。通过增强的输入表示,策略能够利用轨迹信息,而无需显式实现精确规划所需的分位‑状态递归。实验在资产出售的最优停机问题和滑动的 FrozenLake 环境上进行,对比了模型化的 UCB‑BQRL、表格化的 PPO 与 TRPO。结果显示,在资产出售任务中,Deep‑BQRL 在报告的目标分位上取得比 PPO、TRPO 更小的平均累计点分位策略差距,UCB‑BQRL 仍保持最小差距。学习到的停机决策随目标分位变化,直观展示了风险敏感行为。
点评