“线性表征假设”(Linear Representation Hypothesis,LRH)在人工智能、神经科学和认知科学等多个子领域频繁出现。然而,以往的研究并未将 LRH 统一视为可证伪的科学假设,导致概念使用上出现不一致。我们首先梳理了这些不一致的来源,包括对模型本身、表征所在层次、特征定义以及评估数据集的不同假设。随后指出,只有在明确这些因素后,关于线性表征的论断才具备可操作性。基于此,我们提出了一种更为严谨的形式化框架,将模型、表征位置、特征和数据集的依赖关系显式化,从而使 LRH 能够作为可检验的科学命题进行实验验证。最后,本文列举了若干尚未解决的关键问题,如跨模型的表征一致性、不同任务数据集的泛化能力以及对神经解释的定量评估,呼吁社区进一步关注。
点评