生物细胞可以视为相互作用的个体代理,它们的集体动力学在从单细胞到组织再到多细胞有机体的多个层次上产生适应性行为。本文探讨在人工神经系统中,内在奖励是否能够在没有共享外部目标的情况下支持适应、功能专化以及更高层次的自组织。我们回顾了赋能(empowerment)、好奇心、学习进度、信息增益、无监督技能发现、互信息估计以及利用世界模型计算内在奖励的方法。特别关注了这些目标在何种情况下会失效——即未能产生持续探索或日益复杂的行为。我们认为,更强大的系统可能需要互补的目标、通信、记忆、多时间尺度的学习以及环境约束。基于此视角,提出了三条实验方向:① 在资源受限的环境中,使原本稳定的行为吸引子变得不可持续,以检验环境约束是否能缓解内在目标的典型失效模式;② 构建具有每个代理内在奖励的循环网络,观察群体行为的自组织演化;③ 设计层次化世界模型代理,使探索性运动能力先于目标导向行为发展,从而测试内在学习能否在更高层次实现适应性组织。
点评