NeFut Logo NeFut
EN 管理员登录

[AI学术] 微调大语言模型时内部表征变化与因果重要性的解耦

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #LLM

在本文中,作者研究了微调(fine‑tuning)对大语言模型(LLM)内部表征的影响。具体考察了注意力模式、层级激活等变化,并使用 EAP 方法定位对任务性能关键的注意力头和 logits 级别激活。实验发现,这些 EAP 标识的组件主要集中在少数层,表现出功能局部化的特征。然而,这些层的分布与在微调过程中发生最大表征变化的层并不显著相关。进一步的跨任务分析表明,即使不同任务共享相同的 EAP 组件,也不一定能够实现性能迁移;当两个任务在 EAP 组件上高度重叠时,微调一个任务反而可能导致另一个任务的性能下降。

点评:微调虽能快速适配下游任务,但其内部重构并不一定对应功能关键层,跨任务干扰风险需在实际部署时加以评估。

原文链接: https://arxiv.org/abs/2609.21113

[h] 返回首页