作业车间调度问题(JSSP)是工业优化中的经典组合难题。本文提出 PORL(Pretrained Offline Reinforcement Learning),一种先在仿真环境中进行在线预训练、再在生产数据上离线微调的混合方法。在线交互能够探索通用调度策略,但受限于仿真与真实环境的差距;离线强化学习则直接利用历史数据,避免环境交互,却对数据质量和覆盖度高度敏感。PORL 通过先学习通用策略,再使用 KL 散度约束在离线阶段限制策略偏离,从而兼顾两者优势。实验在存在分布迁移的 JSSP 实例上进行,离线数据来源于启发式、噪声专家和随机行为策略。结果表明,PORL 在最优性差距上始终优于单纯离线 RL 和传统基线,且当离线数据质量下降时优势更为显著,说明该方法对数据质量的依赖更低。研究表明,在无法进行在线探索的工业调度场景中,预训练策略的离线适配是一条可行路径。
点评