在这篇文章中,我们研究了有限视野的马尔可夫决策过程(MDP)规划,特别是在根基(决断性)风险目标下。该目标对总回报的分布应用了基于排名的函数,这使得目标在回报分布中呈现非线性特征,并通常打破贝尔曼最优性,因此直接通过场景树枚举进行优化是不可行的。
为此,我们提出了一种新的方法——ERQDP,该方法无需枚举和采样,通过精确动态规划(DP)解决排名-分位数替代问题。我们通过在离散化的回报网格上对回报概率质量函数(PMFs)进行DP来精确评估候选策略,并在一个随时可运行的循环中不断优化替代方案,报告目标的显式上下界(证书),直至离散化预算的限制。
在测试基准中,ERQDP能够返回经过认证的解决方案或显式的残差间隙,支持快速的风险参数扫描,并在运行时间上实现显著的提升,同时适用于风险厌恶和风险追求的行为。
博主点评: 该研究通过引入ERQDP方法,提供了一种有效的途径来处理复杂的风险决策问题,克服了传统方法的局限性,具有重要的理论和实践意义。