正则化自博弈是一类让两人零和策略通过对缓慢变化的熵正则化参考策略 $\rho$ 进行最佳响应,从而收敛到纳什均衡的算法。若游戏的价值等价均衡形成多面体,正则化会隐式打破平衡的等价:在均匀参考下,它会选取最大熵的成员,即 $\rho$ 在纳什集合上的 I 投影。本文探讨能否有目的地利用参考策略来指定目标均衡。
我们在五个可解析的游戏以及一个二维多面体上进行实验,使用精确的最佳响应和等价性检验,采用固定随机种子。将参考策略锚定在目标均衡上并在后续迭代中细化,结果显示自博弈能够以平均坐标误差 0.007 收敛到目标,且其中位利用率为 $5\times10^{-5}$,在 $\pm0.05$ 的容差范围内等价于 TOST 检验。锚定效果在细化过程中保持,并随参考策略而非初始化而变化。选择过程符合加权 I 投影,斜率为 0.969(置信区间 [0.950, 0.987])。
我们同样报告了方法失效的情形:固定的离流形参考会导致 0.08–0.25 的利用率;过于刚性的或平坦的参考族需要更小的镜像步长,需依据预先注册的规则设定;边界目标会出现欠冲,曲率能够预测边界饱和的出现(秩相关 0.90,p=0.037),而内部精度与曲率无关。表格和多层感知机的引导映射在所有目标(30 个随机种子)上误差不超过 $\pm0.03$。对照实验表明注意力的稳健特征是种子方差的增加,系统性偏移不超过 0.018 且不显著。
在面对最佳响应时,选择稳健性与利用率的权衡呈退化:只有在固定、非均衡对手时引导才有意义。我们的经验法则是:将参考策略锚定在期望的均衡并随后细化,这相当于把 RLHF 中的 KL 锚点重新解释为选择旋钮,而不仅是稳定绳索。
点评