NeFut Logo NeFut
EN 管理员登录

[AI学术] 规划还是学习:多资产维护中的可靠性与成本

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#Machine Learning #optimization #Artificial Intelligence

工业维护系统通常包含多个相互作用的资产并共享资源,这使得在单一决策框架下同时保证可靠性和控制运营成本变得十分困难。\ \ 近期研究多聚焦于使用强化学习(RL)进行维护调度,但在完全相同的实验设置下与传统规划方法的直接对比仍然稀缺。\ \ 本文基于轴承的失效直至故障数据,分别对规划方法和 RL 代理在多资产维护场景中的表现进行实验比较,重点考察在不同失效惩罚水平下预防性维护与容忍少量失效之间的权衡。\ \ 实验结果显示,两类方法的行为差异主要来源于目标函数的设定。规划将可靠性作为硬约束,产生零失效策略,其总成本对惩罚系数的大小基本不敏感。相对地,RL 通过最小化期望成本来进行优化,随惩罚系数变化在预防性维护和偶发失效之间进行权衡——在低惩罚情形下成本更低,但即使在高惩罚下仍会出现非零失效。\ \ 为提升 RL 的可靠性,本文尝试了轻量级约束机制,包括奖励塑形和动作屏蔽,这些手段能够在一定程度上降低失效率。\ \ 从实际应用角度来看,当系统必须严格保证可靠性且部署周期较短时,规划方法更为合适;而在可以接受少量失效且更关注长期运营效率的场景下,RL 能提供更具成本效益的策略。两者在不同需求下互为补充。\ \ 此外,本文提出的统一基准协议统一了环境、成本模型和评估方式,为在其他维护场景下比较不同决策方法提供了可复用的模板。\ \ 点评

原文链接: https://arxiv.org/abs/2609.13566

[h] 返回首页