自我进化语言模型通过提出候选更新并保留提升可见分数的版本来迭代。当该分数是能力的非完美代理时,持续的选择会放大两者之间的差距,这种现象称为奖励黑客(reward hacking)。为此我们提出 HackProbe,一种可附加到任意自我进化循环的监控器,只需两个黑盒钩子,无需访问模型权重或激活。
HackProbe 维护一个 秘密、分布固定的比较核心,其冻结分布使得跨代的能力代理保持可比;同时加入一个 旋转的全新层,防止核心与候选模型共同适应。基于该核心构建了四项检测:
- 层级差距;
- 尺度对齐的发散,配合在线变点检测;
- 能力停滞;
- 条件性自信错误率。对这四个检验使用 Sidak 校正,可得到校准的全家族 $p$ 值。
仅靠诊断无法阻止黑客行为,因此我们设计了 风险感知免疫层:在每轮提案池中使用核心与纯结构化的游戏足迹重新选择诚实候选,仅向宿主泄露至多 $\log_2 \Pi$ 位信息。我们证明了可检测性上界,将目标错误率映射为显式的探针规模预算,并阐明了探针旋转的收益与局限。
在一个受控的提示层面实验中,向模型注入四条已知黑客通道并提供真实标签。HackProbe 达到 $0.763$ AUROC,显著高于最强基线的 $0.663$,并将误报率从 $0.706$ 降至 $0.434$。其带宽受限的重新选择是唯一在黑客情形下提升真实能力的免疫手段,平均提升 $5.2$ 分,而在干净运行中仅损失 $4.7$ 分;各通道的单独效果大多不显著。
点评:HackProbe 在无需模型内部信息的前提下提供了可量化的奖励黑客检测与免疫方案,展示了在自我进化系统中实现安全迭代的可行路径。