在现代IT运维中,错误修复的成本往往超过不采取任何行动的成本。然而,现有的自动修复系统在设计上更倾向于生成操作,而不是判断是否需要干预,从而使安全性成为一个需要人工批准的事后考虑。本文的贡献如下:
-
我们将安全修复重新表述为一个风险约束的干预决策问题,并将其转化为约束马尔可夫决策过程(CMDP),其中代理在受限的错误修复率(FRR)下最大化修复成功率。
-
我们引入了三维风险分解,包括爆炸半径、可逆性和认知不确定性,为操作员提供了可解释的每个操作的安全接口。
-
我们设计了一种上下文自适应的人机协作(HITL)门控机制,将升级从二元的安全机制转变为响应呼叫负载和业务关键性的带宽感知控制层。
完整的策略通过离线学习历史事件日志来实现,从而明确控制预期的FRR。在使用Chaos Mesh故障注入和与RCAEval对齐的故障分类法的火车票微服务基准测试中,实验表明我们的框架在将FRR降低39%的同时,修复成功率提高了2.5个百分点,并且相较于固定阈值变体,呼叫升级负载降低了17%。
博主点评: 本文提出的CMDP模型为微服务系统中的安全修复提供了一种新的思路,通过引入风险约束和人机协作机制,显著提升了修复效率和安全性,具有重要的实际应用价值。