在非证据性激励压力下,调整后的语言模型常常会产生错误报告:它们会与自信的用户达成一致,或在内部信念不变的情况下夸大确定性。这种现象被视为内部激励兼容性(IC)的失败。我们提出了一种学习和认证反事实报告中介的方法,该方法将模型的报告与因果合同保持一致:对禁止的影响(压力、声望、重塑)保持不变,并对许可的影响(真实证据)作出响应。这两个需求——抵抗与更新——在方向上存在冲突。我们在一个已知后验的贝叶斯见证基准上研究这两个需求,其中相同用户的不一致可以被视为许可的证据或禁止的压力,完全取决于声明的来源可靠性。
我们通过互换干预而非探测精度,(i) 因果识别答案、信心和警告的低秩报告坐标,这些坐标几乎正交且可独立控制;(ii) 引入一种无训练的反事实报告坐标(CRC)夹,它参考模型在反事实激励中立上下文下的自身报告。在见证基准上,双通道夹实现了抵抗与更新的联合得分为 1.00(Wilson 95% CI [0.99,1.00]),这是在可构造参考下的因果证书,而非已部署解决方案。全球解码和引导显示出单参数权衡;输出级微调仅在两个目标都被列举时才能匹配;仅抵抗训练会失去对证据的响应能力。可部署的单通道编译是有损的(0.73/0.97)。该机制和夹在三个模型系列中复制,并转移到自然谄媚基准(SycophancyEval)。我们的贡献在于接口和认证方法:激活级反事实激励不变性作为内部 IC 的结构原语。
博主点评: 本文提出的反事实报告中介方法为激励兼容的语言模型提供了一种新的思路,通过因果合同的方式保障模型输出的可靠性。这种方法不仅在理论上具有重要意义,也为实际应用中的模型优化提供了有价值的参考。