摘要
AI 研究者将最先进的模型视为在规模上重复的单一结构:Transformer,无论是处理文本、图像还是语音,都是相同的连线方式。神经科学家则将大脑皮层描述为马赛克——视觉皮层的密集第 4 层用于空间编码,运动皮层的厚重第 5/6 层用于时间整合——不同的任务由不同的结构解决。本文认为,这一差距是结构性错误,而非风格性错误,并且是可以测量的。
一个世纪的细胞结构研究,从 Brodmann 到单细胞 Patch-seq,表明不同的认知功能是由质的不同的结构实现的,而不是通过简单的模板缩放。卷积神经网络是该领域的自我证明:局部感受野和层次深度直接编码了这一先前知识,在远少于后续架构所需的数据上实现了强大的图像识别。
本文追溯了这一教训被抛弃的历程:“硬件彩票”使 Transformer 成为最简单的选择,而非原则性的选择。Mixture-of-Experts 常被引用为多样性,实际上是将参数划分给相同的专家。功能主义分析表明,Transformer 最好被理解为海马体的功能类比,而非通用皮层——这与将皮层视为一个巨型 Broca 区的错误相同,只不过该领域现在标准化为一个巨型海马体,应用于其从未构建的任务:听觉、执行门控、工作记忆。
论文最后提出了一种替代方案:异构拓扑网络,一个系统的系统,其中不同的模块保持其计算所需的归纳偏差,并通过标准化接口进行通信。这是一种针对 AI 架构师的设计学科,而非认知科学:在训练之前明确模块化,利用结构证据作为设计输入,而不是从训练模型的行为逆向工程架构。
博主点评: 这篇论文深入探讨了当前 AI 模型设计的结构性缺陷,强调了模块化设计的重要性。通过建立异构拓扑网络的概念,作者为未来的 AI 研究指明了方向,挑战了单一模板的思维模式。