摘要
大型语言模型(LLMs)的黑箱特性要求我们建立超越表面性能指标的新评估框架。本研究利用布鲁姆分类法作为层次性视角,探讨认知复杂性的内部神经表征。通过分析来自不同 LLM 的高维激活向量,我们探测不同认知层次(从基础回忆到抽象综合)在模型残差流内是否线性可分。
我们的结果表明,线性分类器在所有布鲁姆层次上平均达到了约 95% 的准确率,强有力地证明了认知层次在模型表征的线性可访问子空间中被编码。这些发现表明模型在前向传播的早期就能够解决提示的认知难度,并且随着层级的加深,表征的可分性逐渐增强。
博主点评: 本文通过布鲁姆分类法的层次性视角,深入探讨了 LLM 内部的认知复杂性,结果显示模型在处理任务时能够有效区分不同认知层次,这为理解大型语言模型的内部机制提供了重要的启示。该研究不仅拓展了 LLM 的解析框架,也为未来的模型优化奠定了基础。