贝叶斯推断为不确定性下的推理提供了原则基础,但其计算成本阻碍了在资源受限的边缘设备上的部署。本文提出了一种硬件导向的方法来加速商业现货嵌入式GPU上的离散贝叶斯推断。我们发现广泛类别的变分消息传递算法的延迟主要由张量收缩主导。
我们的方案通过两种互补的合并策略重构这些操作的内存布局,生成更紧凑、规则形状的原语,更适合高效的GPU执行。接着,我们引入可选的稀疏数组表示和张量聚类方案,以减少内存占用。
我们实例化该方法,针对隐马尔可夫模型(HMMs)生成三个消息传递算法的优化变体,即变分滤波、变分消息传递和边际消息传递。此外,我们还配备了一种基于机器学习的自调优器,能够自动选择针对给定生成模型规范的最佳算法变体。
在NVIDIA Jetson Orin AGX上针对770个随机采样的现实部分可观测马尔可夫决策过程(POMDP)配置进行基准测试,我们的实现达到了最高5倍的加速,典型增益为2-2.5倍,同时输出与基线实现数值完全相同。
博主点评: 本文通过硬件优化手段显著提升了贝叶斯推断在嵌入式设备上的效率,尤其是在GPU执行方面的创新值得关注。采用的稀疏数组和张量聚类策略,不仅减小了内存占用,也为算法的灵活性提供了支持,这在实际应用中具有重要意义。值得期待的是,未来的研究能进一步扩展到更多类型的模型和算法上。