NeFut Logo NeFut
EN 管理员登录

[AI学术] 可解码但非可拆卸:训练数据粒度决定大型语言模型的参数模块性

发布于:2026-08-12 22:00 最后更新:2026-08-13 01:53
#Machine Learning #LLM #Neural

最近的一项研究探讨了大型语言模型中参数模块性的问题。研究人员尝试了解这些模型是否包含特定领域的参数外壳,即集中、因果必要的神经元群,其移除会选择性地降低目标领域的性能,同时保留其他领域的性能。他们采用了一种统一的因果方法,应用于两个领域粒度、三个模型家族(1.5B到7B参数)和八个领域。结果表明,在学科层面上,不存在超过60%领域选择性的神经元,尽管领域身份可以在85%的准确率上线性解码。在语言和模态层面上,0.65--1.14%的神经元超过60%的选择性,损伤矩阵近乎完美对角(比率高达595:1),且外壳神经元集基本上是分离的(IoU \text{Intersection over Union})。这项研究揭示了训练数据粒度对大型语言模型参数模块性的重要影响。 博主点评: 本文对大型语言模型的参数模块性进行了深入的探讨,揭示了训练数据粒度与参数模块性之间的重要关系。这些发现为我们理解和优化大型语言模型提供了新的见解和方法。

原文链接: https://arxiv.org/abs/2608.10214

[h] 返回首页