NeFut Logo NeFut
EN 管理员登录

[AI学术] 预见未来:深度强化学习的前瞻解释

发布于:2026-08-12 22:00 最后更新:2026-08-13 01:53
#Machine Learning #Artificial Intelligence #Deep Reinforcement Learning

深度强化学习(DRL)代理在复杂环境中取得了强大的性能,但是其决策过程仍然难以解释。我们提出了SPOT(Sampling Policy Observation Tree),一种新颖的模型无关、基于采样的框架,用于解释DRL策略。给定策略和环境模拟器的访问权限,SPOT通过采样动作和递归模拟结果后继状态来构建一个可解释的有限视野树。该树提供了策略的动作偏好及其可能的下游演化的经验表示。我们提供了正式的保证,确立了SPOT在渐近情况下恢复策略的唯一最可能动作的能力,并描述了其在高熵策略下的不一致行为。我们在SUMO-RL交通信号控制领域展示了SPOT。案例研究说明了如何使用其树结构表示来检查策略偏好、比较替代未来轨迹并揭示单步特征归因方法无法看到的下游行为。 博主点评: 本文提出了一种新颖的深度强化学习解释框架SPOT,能够提供策略的前瞻解释和下游行为的分析,对于理解复杂环境中的决策过程具有重要意义。

原文链接: https://arxiv.org/abs/2608.09967

[h] 返回首页