在这项研究中,我们将链外数据的密码审计建模为受限马尔可夫决策过程(CMDP),并考虑了部分可观测性:存储节点的隐藏类型和腐败状态使得该问题成为部分可观测马尔可夫决策过程(POMDP),而错失率上限 \rho 则施加了明确的安全约束。我们提出了 DRQN-CMDP,这是一种深度递归 Q 网络,其 GRU 层维护对潜在节点类型的信念,并结合拉格朗日对偶上升方法自动调整错失率惩罚 \lambda。配对无关的同态 MAC 原语保证了 O(1) 的链上验证成本。在比较的13种方法中——四种 DQN 变体、PPO、A2C、PPO-拉格朗日、一个有状态的贝叶斯启发式、三个固定规则基线以及一个信息源启发式——DRQN-CMDP 在所有三项目标上均实现了有利的平衡:相比固定高频审计,其燃气费用降低了83%,错失率保持在单数字(7.5%),且检测延迟适中——这一组合在所有方法中无可匹敌。
博主点评: 本文通过引入深度学习和强化学习技术,显著提升了链外数据审计的效率,尤其在成本和准确性之间找到了良好的平衡。DRQN-CMDP 的创新之处在于其动态调整惩罚机制,展现了现代机器学习在安全领域的潜力。未来的研究可以进一步探索在更复杂环境中的应用场景。