NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示微调大型语言模型中的道德偏见机制

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #Neural

在这项研究中,我们探讨了大型语言模型(LLMs)在微调过程中如何内化人类道德偏见,尤其是著名的 Knobe 效应。这种偏见在意图判断中表现出来,但其具体机制尚不清楚。

我们通过对三种开源 LLM 进行层补丁分析,发现这种偏见不仅在微调过程中学习而来,还局限于模型的特定层次。

意外的是,我们发现仅需将相应预训练模型的激活值补丁到几个关键层中,就可以有效消除这一效应。这一发现为我们提供了新的证据,表明 LLM 中的社会偏见可以通过有针对性的干预措施进行解释、定位和缓解,而无需重新训练模型。

博主点评: 本研究深刻揭示了微调大型语言模型中道德偏见的复杂性,强调了通过局部干预而非全面重训来应对偏见的新策略,具有重要的理论和应用价值。通过层补丁技术,研究者为理解和改进 LLM 的道德判断提供了新的视角。

原文链接: https://arxiv.org/abs/2510.12229

[h] 返回首页