在这项研究中,我们探讨了大型语言模型(LLMs)在微调过程中如何内化人类道德偏见,尤其是著名的 Knobe 效应。这种偏见在意图判断中表现出来,但其具体机制尚不清楚。
我们通过对三种开源 LLM 进行层补丁分析,发现这种偏见不仅在微调过程中学习而来,还局限于模型的特定层次。
意外的是,我们发现仅需将相应预训练模型的激活值补丁到几个关键层中,就可以有效消除这一效应。这一发现为我们提供了新的证据,表明 LLM 中的社会偏见可以通过有针对性的干预措施进行解释、定位和缓解,而无需重新训练模型。
博主点评: 本研究深刻揭示了微调大型语言模型中道德偏见的复杂性,强调了通过局部干预而非全面重训来应对偏见的新策略,具有重要的理论和应用价值。通过层补丁技术,研究者为理解和改进 LLM 的道德判断提供了新的视角。