NeFut Logo NeFut
EN 管理员登录

[AI学术] 信息导向采样:因果带式优化新方法

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #C++

因果带式(Causal Bandits)利用变量之间的结构关系,通过干预之间共享信息,加速高奖励决策的识别。然而,在许多应用中,一些变量无法直接操控,尽管它们对奖励有影响,并为潜在的因果系统提供有用信息。本文研究了具有不可操控变量的上下文因果带式,其中上下文变量在选择行动前被观察,而额外变量在每次干预后被观察。假设已知因果图且不存在潜在混淆,我们采用贝叶斯框架,其中观察分布的条件概率表构成未知参数。这种表示方式允许在一个干预下收集的观察数据通过共享的因果机制更新其他干预的奖励估计。

我们为这一设置开发了因果变体的汤普森采样(Thompson Sampling)和信息导向采样(Information-Directed Sampling,IDS)。对于汤普森采样,我们建立了一个依赖于熵的次线性贝叶斯遗憾界限。对于IDS,我们推导出一个依赖于熵的遗憾界限,明确量化了蒙特卡洛近似预期遗憾和信息增益所引入的附加误差;当这些量准确可用时,该界限恢复了标准的次线性IDS速率。此外,我们还为算法使用的蒙特卡洛估计提供了高概率的置信界限。对多个合成因果带式任务的实验表明,所提方法通过更有效地利用干预之间共享的信息,超越了因果和非因果基线。

博主点评: 本文提出的信息导向采样方法在因果推断中展现了强大的潜力,尤其是在处理不可操控变量时。结合贝叶斯框架的应用,使得模型在实际任务中能更精准地进行决策,具有较高的实用性和理论价值。

原文链接: https://arxiv.org/abs/2607.15577

[h] 返回首页