NeFut Logo NeFut
EN 管理员登录

[AI学术] 循环变换器内部状态中的关系偏好编码研究

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#Tech

在这项研究中,我们探讨了循环变换器如何编码人类偏好,并在冻结的 Ouro-2.6B 循环迭代状态上训练轻量级评估头,基于 Anthropic HH-RLHF。原稿的主要结果经过后续审核发现存在两个独立的评估错误,导致三项头条结果被夸大。

95.2% 的成对评估器准确率是一个典型的排序伪像:数据正确拆分,但评估器学习到偏好首个呈现的论点;其在完整 8,552 对测试集上的严格反对称准确率为 63.9%。84.5% 的成对探测和低于随机机会的 21.75% 的逐点探测则是源项泄漏(方向行和成对伙伴交叉了训练/测试拆分);修正后的成对不相交值为 56.5% 和 54.2%,高于随机机会,因此“反向极性”发现被撤回。

中心发现仍然存在,但幅度显著减小:相对解码比逐点解码更准确(成对 +2.3 分,95% 置信区间 [+1.3, +3.3]),反对称评估器仍优于线性探测,但没有修正的读出能与端到端奖励模型相媲美。

方法论发现依然成立(常量输出退化、翻转测试、交换协议度量膨胀),但有一个修正:反对称准确率,而不是反对称相关性,证明了关系判别。两个错误是互相不可见的——拆分审核无法看到排序先验,反对称化无法看到泄漏——因此需要两种检查。后续工作将进行全面审核(Kirin, 2026,准备中)。

博主点评: 这项研究揭示了循环变换器在偏好编码上的复杂性,强调了评估过程中的细微差别及可能的误导性结果。研究者们的严谨性体现在对错误的审查与修正上,突显了在模型评估中进行全面审核的重要性。

原文链接: https://arxiv.org/abs/2604.09870

[h] 返回首页