人类在面对新任务时会直接迁移已有的行为知识,而不是从零开始学习。强化学习(RL)代理同样可以利用这种迁移:已知的行为模式只需被调用,而不必重新学习。神经符号RL通过在学习策略旁注入符号知识,实现了先验知识与RL的结合。关键在于何时将这些知识注入学习循环;不恰当的时机会导致前置条件的幻觉,从而在动态环境中引发安全和可靠性问题。我们将行为知识形式化为一个关于结构动作的前置条件贝叶斯网络(BN),结构动作指其合法性依赖于前置条件的操作,例如捡起钥匙、抓取方块、开关门或放下物体。该BN限制结构动作的触发时机,并在RL循环中以三种方式嵌入:
- 符号验证器:仅在推理阶段查询BN,仅当前置条件满足时才执行结构动作。
- 符号执行器:在训练和推理阶段均生效,始终依据BN约束结构动作的使用。
- 符号学习器:将BN的约束直接融合进网络本身,使网络自行学习结构动作的限制与使用方式。
我们在两个对立的基准上评估这三种变体:一个基于长序列、严格顺序的规划链(MiniGrid),另一个基于连续操作的机械臂任务(Fetch)。评估指标包括解的质量、样本效率和可追溯性。实验结果显示,三种嵌入方式均显著提升了性能。MiniGrid 上,符号执行器的解质量达到 $98.2\%$,相较基线 PPO+RND 的 $88.8\%$ 有明显提升;其他两种方式也分别取得了 $96.5\%$ 与 $95.3\%$ 的提升。Fetch 环境中,符号验证器和符号学习器在样本效率上分别提升约 $30\%$ 与 $35\%$,并保持了较高的轨迹可解释性。整体来看,将前置条件BN以适当方式注入RL,可在不增加额外监督信号的前提下,显著改善代理的安全性与效率。
点评