当一个知情的对手与受限信号通道共享受众时,最能保护真相的信号恰恰是对真相描述最完整的信号。我们在 108 项确认性实验中发现,对手鲁棒的最优解与先前工作中的显著极点完全一致。
在一个包含 200,000 项的更大数据池中,两者仅在 2,748 项上出现差异——这些恰好是先前显著到贝叶斯坐标未定义的点。对已定义的项目而言,鲁棒性通过完全从贝叶斯判别转向显著实现。
实验中我们向一个强制选择任务(抽象自《Deception: Murder in Hong Kong》)引入对手。对手已知目标,观察信号,并在说服预算 $\beta$ 下争取最强的错误答案。随着 $\beta$ 增大,最优信号从后验最大化的选项转向边际最大化的选项;当 $\beta = 0$ 时,游戏复现原始 oracle 模型,听众温度 $\tau = 1$。
关键发现是,18.2% 的项目在有限预算下其最优解会发生转移,并且每项的临界预算恰好可确定。两种对手框架使七个语言模型在 108 项中有 30 到 77 项的选择发生改变,显著高于精确的零效应率。然而,无法测量这种变化是朝向对手感知的最优解还是朝向显著,因为两者在这些项目上是相同的。这是一种结构性限制,而非无效结果。
实用建议:在评估对手感知之前,先检查鲁棒目标是否与启发式目标在评估项上重合。该诊断检查成本低。
点评