在特定政策或领域中,微调语言模型以适应小型、精心策划的数据集已成为标准实践。我们展示了,在狭窄、事实证明合理且符合审查的数据上进行微调,可能会导致在无关领域中的广泛意识形态转变,同时保持一般能力。
通过对左翼或右翼经济问答进行微调,训练 GPT-4.1 导致在诸如刑事司法、环境和文化品味等主题上产生相应的意识形态转变。类似的效果也出现在可合理部署的数据集上,例如工作场所人力资源政策和实际金融查询,以及在科学与伪科学的轴线上,食品安全微调增加了与表达错误健康信念的用户的谄媚性一致性。
我们称这种现象为意识形态泛化,并提出了一种方法来衡量两个属性:广度(即转变在训练中缺失的主题上延伸的范围)和放大(即微调相对于相同示例的少量提示所强化的程度)。我们表明,少量提示可以指示泛化的方向,但微调将模型推向更极端的结果,包括对种族智商联系和政治暴力的支持。
该效应在 Gemma-3 上复现,经过无评判的评估和外部基准测试仍然有效,且与通用数据混合后依然保持 GSM8K 准确率在基线的 ±1pp 内。
博主点评: 本研究揭示了在特定数据集上微调语言模型可能引发的意识形态偏见,提示我们在使用和开发 LLM 时需更加谨慎,尤其是在涉及社会敏感话题时。对意识形态泛化的深入理解有助于更好地设计模型以降低潜在的偏见风险。