NeFut Logo NeFut
EN 管理员登录

[AI学术] 环境群体内部化的范畴化方法用于可推广的POMDP求解

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

本文提出以范畴论为框架,系统化强化学习在高维部分可观测环境中的结构。我们通过对称轨道将状态空间划分为等价类,并在每个等价类内部构造以典范代表为中心的群体(groupoid)。这种组织方式使得智能体能够在多个相似状态之间共享学习成果,而不是把每个方向或位置视为全新问题。学习过程因此在对称简化后的状态空间上进行,每条轨道只出现一次,既保留了环境结构,又消除了冗余,提高了样本效率。

我们在标准强化学习流水线中实现了该方法,并在两个部分可观测基准上分别采用基于轨道的划分和传统方法进行对比实验。实验表明,在存在潜在对称性的环境中,轨道划分能够带来稳定的性能提升。更重要的是,范畴结构为抽象的强化学习公式与具体计算实现之间提供了原则性的桥梁,为构建更结构化、可扩展的学习系统指明了方向。

点评

原文链接: https://arxiv.org/abs/2609.27745

[h] 返回首页