NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于即时成本CVaR的风险规避在线POMDP规划及性能保证

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

在线POMDP规划通常最小化期望累计成本,但当信念分布在高成本状态上时,期望会掩盖潜在危险。已有的风险规避方法在价值函数上引入静态或动态CVaR,捕获轨迹层面的风险,却存在两个缺陷:①仅对即时成本取信念上的期望,未处理信念内部的风险;②通过修改价值函数,需要专门的算法,无法直接复用现有的期望式规划器。本文提出在每一步对信念上的即时成本直接施加CVaR,目标仍保持期望累计回报,从而问题保持标准MDP结构。只需在成本计算阶段替换为CVaR,即可让任意基于期望的POMDP规划器具备风险敏感性。我们继承了策略评估和稀疏采样的有限时间保证,且估计误差与风险水平无关。核心理论结果是给出粒子信念MDP近似与原始POMDP之间的有限时间误差界,进而得到从真实POMDP价值到算法估计的端到端保证。在风险中性极限下,模型回退为传统的期望规划。$$\text{CVaR}_\alpha(X)=\min_{\eta}\left\{\eta+\frac{1}{1-\alpha}\mathbb{E}\big[(X-\eta)_+\big]\right\}$$

点评

原文链接: https://arxiv.org/abs/2609.35874

[h] 返回首页