摘要
隐状态探测器通常在不完美信息序列模型中恢复潜在标签,但这不足以证明模型保持对隐状态的后验信念分布。本文研究了这一模糊性,聚焦于仅基于动作和价值目标训练的无范围限注德州扑克自回归模型,而不依赖于对手的手牌或范围。
在三个种子中,有两个种子的对手范围探测在动作/价值控制之后是正面的,行为头使用仅可观察的公共历史对保留动作的预测比基线高出约五个百分点。然而,明显的公共投注组成比残余隐状态解释了更多的对手范围信号,这表明大部分可恢复的信息来自投注摘要。
动作/价值+组成基线的前十名准确率达到16.5-16.7%,而组成-残余隐探测器降至11.4-12.2%。在每个种子中,匹配组成比较均为负值。我们称这种证据模式为组成界限预测支持:隐状态保持行为预测性且与对手范围相关,但大部分可恢复的范围信息是由可见的投注组成解释的,而非残余隐状态结构。
这是对对手范围表征证据的案例研究声明,而不是精确的贝叶斯后验追踪或因果信念机制。合成控制和Oracle验证显示,相同的诊断能够接受后验敏感状态,并在匹配控制下拒绝原始组成状态。因此,正面信念探测应通过有针对性的替代方案进行解读,而不是被视为信念追踪的证据。
博主点评: 本文深入探讨了扑克自回归模型中隐状态与对手范围信息的关系,揭示了可见投注组成在信息恢复中的重要性,为序列模型的理解提供了新的视角。对信念追踪的分析也促使我们重新审视模型的有效性与复杂性。