NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示分布强化学习风险声明的真相

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#algorithm #AI #Machine Learning

在分布强化学习中,智能体学习完整的回报分布,并逐渐被直接解读以实现可解释性、风险敏感控制和安全监控。本文提出一个理论预期但未直接测量的问题:经过训练的分布智能体的风险声明是否真实?我们的审计结合了一种决策相关的筛选指标——顶两行动之间的超额瓦瑟斯坦差距(表示一阶随机主导性被违反的质量),利用快照重启蒙特卡罗法的真实数据,以及统计工具(置换零假设、引导反驳、FDR控制),否则审计本身可能得出错误结论。

在QR-DQN、C51和IQN的33次MinAtar实验中,强烈声明的风险权衡在95%置信度下被驳斥的比例达到40-95%。最强声明的统计位置与无真相的情况无显著差异,几乎没有声明可以被确认:对于这些智能体,学习到的“风险”反映的是训练伪影而非环境随机性。

该伪影是结构性的(在训练早期完全形成,与最终得分无关,且对每个种子都有特异性),并且在全Atari规模下几乎没有变化,每个预训练的接近最先进的QR-DQN在Breakout中的强声明都被驳斥。已知大小的正控制确认了96-100%的真实声明(相关性0.89-0.92):测量的是智能体,而非审计。

根据其最被标记状态的CVaR建议进行的行动,从有利到明显低于随机水平。训练风险或集成并未消除该伪影,而重新校准仅通过使声明无效而通过审计:智能体的头部信息不可用,而不仅仅是校准错误。我们发布了工具包,并记录了两个在我们自己的审计中产生令人信服但错误结果的隐性陷阱。

博主点评: 本文通过严谨的审计方法揭示了分布强化学习中风险声明的虚假性,强调了训练过程中的伪影问题。这一研究不仅对提升强化学习模型的可靠性具有重要意义,也为未来的风险敏感控制提供了有价值的参考。

原文链接: https://arxiv.org/abs/2607.11607

[h] 返回首页