现有的细胞自动机及其他复杂系统的探索方法大多采用开环模式:设定初始条件,完整运行仿真,然后被动观察结果,整个过程不进行干预。本文提出一种基于自我目标(autotelic)强化学习的闭环框架,智能体能够自主采样多样化目标,并学习目标条件化策略,通过最小、局部的扰动在系统运行时进行干预。我们在 Lenia——一种以连续形式实现、能够产生类生命自组织图案的细胞自动机上实现该框架,构建了名为 CARL 的智能体系统,并展示了三项关键能力:
- 发现稳定孤子:CARL 在广泛的 Lenia 更新规则下,以显著高于启发式基线的速度发现稳定的自组织结构(孤子)。
- 引导孤子运动:通过少量干预,CARL 能够改变已有孤子的运动方向,证明其不仅能创造自组织模式,还能实现精确控制。
- 人机协同导航:在人类提供高层次方向指令的情况下,训练好的智能体实时将指令转化为低层次扰动,引导孤子在迷宫环境中穿行。
这些智能体在多目标、不同更新规则以及随机初始状态的训练过程中,学习到的策略能够零样本迁移到多种分布外情形,表现出强大的泛化能力。本文的实验结果表明,构建能够自主或在人类指导下发现并操控复杂系统中涌现现象的人工实验者是可行的,为未来的自动实验平台奠定了基础。
博主点评:这篇工作将自我目标强化学习与连续细胞自动机巧妙结合,展示了从发现到控制的完整闭环流程。尤其是人机协同的实时导航实验,凸显了该框架的实用潜力。若进一步扩展到更高维度或真实物理系统,或将开启人工实验者在科学探索中的新篇章。