NeFut Logo NeFut
EN 管理员登录

[AI学术] 用决策树实现MDPs的可解释性与最优性之间的权衡

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#algorithm #AI #optimization

在过去十年中,决策树被广泛应用于以可解释的方式表示控制器(即策略),其中 dtControl2 是当前的先进工具。然而,对于大型系统或存在许多边界情况的系统,这种表示往往过于复杂,难以被人类理解。减少决策树的规模并非易事,因为缺失一个关键案例可能导致控制器不正确。我们在马尔可夫决策过程的背景下解决了这一问题,通过引入 "\varepsilon" 功能扩展 dtControl2:给定一个允许的误差 \varepsilon \geq 0,我们构建一个更小的决策树,提炼控制器的本质,同时保证其 \varepsilon-最优性。这使我们能够提供可调的更简单的解释,省略可控的细节量。我们的工具构建的决策树比现有技术小几个数量级。

博主点评: 本文通过引入可调的误差参数 \varepsilon,有效地在可解释性与控制器的最优性之间达成了平衡,为决策树的应用提供了新的思路,尤其适用于复杂系统的场景。

原文链接: https://arxiv.org/abs/2607.25925

[h] 返回首页