在自主机器人领域,处理不确定性是至关重要的能力。部分可观察马尔可夫决策过程(POMDP)为这种能力提供了强大的框架。尽管基于POMDP的规划已有显著进展,但在实际问题中的应用往往受限于获取准确的POMDP模型的困难。
我们提出了学习扩散模型的在线规划框架VOiLA(Vectorized Online planning wIth Learned diffusion model for POMDP Agents),该框架能够在线学习任务无关的POMDP模型以应对不确定性。
VOiLA通过条件扩散模型学习状态转移和观察采样器,并为基于粒子的信念更新学习观察似然模型。为了实现高效的在线规划,扩散采样器被提炼为紧凑的前馈生成器,并与向量化在线POMDP规划器(VOPP)集成,后者旨在利用GPU并行化。
实验结果表明,提炼策略使得采样成本降低了近三个数量级,使得学习的生成POMDP模型在在线规划中变得实用。在三个基准问题上的评估表明,VOiLA的性能与递归软演员评论(Recurrent Soft Actor Critic)相当或更优,同时使用的训练数据不足10%,并且在未见环境配置上的泛化能力更强。物理机器人评估表明,VOiLA使用仅通过模拟数据学习的模型生成的策略,在10次尝试中成功完成任务10次。
博主点评: VOiLA通过引入学习的扩散模型,显著提高了POMDP在动态环境中的适应性和效率。这一方法不仅降低了计算成本,还提升了在真实环境中的泛化能力,为自主机器人技术的实际应用提供了新的可能性。未来的研究可以进一步探讨如何在更复杂的任务中优化这一框架。