NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性探索:通过期望自由能优化部分可观察决策

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Machine Learning

在部分可观察环境中,代理需要决定何时收集信息以及哪些观察是值得的。标准的部分可观察马尔可夫决策过程(POMDP)仅通过其对奖励的最终影响来评估信息价值。而$ ho$-POMDP框架则直接奖励不确定性减少,采用基于信念的效用$ ho$,但在实际中,$ ho$的选择和权重通常需要为每个任务手动调整。

我们证明,主动推理完全消除了这种调整。最小化期望自由能(EFE)与解决一个$ ho$-POMDP是完全等价的,其效用为预期信息增益,探索权重固定为$w=1$,因为变分界限以相同的单位(nats)表达实用价值和认识价值。

我们为观察-再承诺POMDP证明了这种等价性,并将其扩展到因子观察POMDP,这是一类更广泛的覆盖交错观察-行动问题(如无损检测和移动传感)的框架,其中信息收集不会改变隐藏状态。

实验结果支持了这一理论。在从经典的老虎问题到RockSample以及新的结构检查基准(具有超过65,000个状态)等各种环境中,未调节的权重与相同时间范围内的仅奖励规划相匹配或表现更好,避免了针对每个任务调优的过度探索,并且接近成功-奖励Pareto前沿的奖励最大化拐点。实际收益是一个开箱即用的探索目标。

在故障检测和医疗筛查等应用中,每个测试都有成本,每个遗漏的故障都有代价,EFE提供了一种基于信念的效用,这种效用是推导而非调优的。

博主点评: 该研究通过引入期望自由能为决策提供了新的视角,强调了在复杂环境中高效探索的重要性。尤其是在成本敏感的应用场景中,基于信念的效用将极大提升决策的可靠性与效率。它不仅为理论研究提供了坚实基础,也为实际应用开辟了新的可能性。

原文链接: https://arxiv.org/abs/2607.16981

[h] 返回首页