在这篇论文中,我们研究了参数化动作马尔可夫决策过程(PAMDP)中的强化学习。在该场景下,每个决策由符号动作和数值参数组成。传统的强化学习算法通常使用一次性估计器来确定参数,这导致样本效率低下。尽管在大多数PAMDP环境中存在显式但不完整的知识(如规则、安全约束或专家启发式),但这些知识很少被直接用于提高强化学习代理的样本效率。为填补这一空白,我们提出了新颖的神经符号知识与梯度引导强化学习(KGRL)算法。
KGRL利用Datalog知识库中的领域知识推导出给定状态下适用的动作集合和可行参数集。这使得它能够从决策空间中剔除不适用的动作,并约束剩余动作的参数空间。接着,我们使用基于梯度的参数细化循环在训练和部署过程中估计最优参数。通过记录沿轨迹激活的规则,KGRL还提供了关于动作剔除和参数约束的局部过程解释。总体而言,KGRL引导代理的探索和部署朝向可行且考虑约束的决策,同时提高训练期间的样本效率。KGRL在样本效率和回报率方面均优于当前最先进的PAMDP强化学习基线。
博主点评: KGRL算法通过结合领域知识和梯度优化,显著提升了强化学习在复杂决策过程中的样本效率,展示了知识驱动方法在现代强化学习中的潜力,为未来的研究提供了新的视角。其在实际应用中可能会引领更智能的决策系统的发展。