本文提出一种面向高度灵活、模块化制造系统的数据驱动自学习控制方法。核心是基于模型的强化学习框架,在策略训练阶段引入近似逆过程模型。逆模型将执行器动力学与状态空间动力学解耦,使得强化学习仅在任务空间进行。我们设计了轻量前馈网络实现近似逆模型,并将其嵌入标准强化学习算法的策略网络。该方法在包含异构生产模块的实验室模块化生产平台上验证。实验表明,尤其在离线(off‑policy)算法下,系统在性能和训练速度上均实现显著提升。
点评:该方法通过逆模型有效降低了学习复杂度,提升了模块化生产的适应性和训练效率。