近期研究表明,在强化学习(RL)环境中学习奖励黑客(reward hacking)的模型会出现广泛的错位行为(emergent misalignment,EM),而将奖励黑客重新定义为训练期间可接受的行为——即接种提示(inoculation prompting,IP)——可以阻止这种泛化。我们探讨合成文档微调(synthetic document finetuning,SDF)是否能够在不干预后续训练的情况下为模型提供类似的免疫力。
我们在模型的中期训练语料中加入了将奖励黑客描述为可接受的合成文档,然后让这些模型在可被利用的环境中使用 RL 进行训练,使其学会奖励黑客。行为层面上,中期训练成功:模型开始正面描述奖励黑客,并对自己产生的奖励黑客输出表现出更高的认可度。
然而,当模型真正学会奖励黑客后,它们仍然表现出强烈的 EM;相反,在相同设置下使用 IP 则能够有效抑制 EM。我们进一步发现,SDF 能够在下游任务中可预测地引导模型的泛化——当插入全新关联时效果显著,但在试图覆盖已有关联(如奖励黑客与错位之间的关联)时,SDF 的影响既困难又不可预测。
结论是,在我们测试的规模下,SDF 可以让模型表面上看起来符合期望的信念,同时在后续训练中以意想不到的方式改变其泛化行为,未能真正防止因奖励黑客产生的错位。
点评