在本文中,作者研究了微调(fine‑tuning)对大语言模型(LLM)内部表征的影响。具体考察了注意力模式、层级激活等变化,并使用 EAP 方法定位对任务性能关键的注意力头和 logits 级别激活。实验发现,这些 EAP 标识的组件主要集中在少数层,表现出功能局部化的特征。然而,这些层的分布与在微调过程中发生最大表征变化的层并不显著相关。进一步的跨任务分析表明,即使不同任务共享相同的 EAP 组件,也不一定能够实现性能迁移;当两个任务在 EAP 组件上高度重叠时,微调一个任务反而可能导致另一个任务的性能下降。
点评:微调虽能快速适配下游任务,但其内部重构并不一定对应功能关键层,跨任务干扰风险需在实际部署时加以评估。