NeFut Logo NeFut
EN 管理员登录

[AI学术] 层程序在大语言模型中的研究——类皮层视角

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#algorithm #Machine Learning #LLM

LLM 的推理通常采用固定深度、固定顺序的前向传播,即每个输入都会依次经过所有层。人脑并非如此:它通过丘脑作为枢纽,根据需求灵活地将信息路由到皮层的不同区域。Li 等人(2026)提出的 program‑of‑layers (PoLar) 将 Transformer 的层视作函数库,而非固定序列,从而实现类似的人脑路由机制。PoLar 会根据输入动态选择跳过或重复连续的层块,形成自适应的层程序。

我们在 5 种模型上复现了 PoLar 的诊断性 MCTS(蒙特卡罗树搜索),并验证了原文的几项关键结论:

实验还显示,简单问题只需较短的程序即可解决,而难题往往需要更多的层重复。值得注意的是,我们未能复现作者关于单次推理路由器的核心声明:该路由器的最高预测始终退化为标准前向传播,尽管其 top‑k 程序集合整体上仍能提升准确率。

进一步分析表明,少量通用程序已经足以覆盖大多数问题。我们对这些程序的结构和鲁棒性进行了深入探讨,发现用于纠错的程序极其脆弱——在程序内部撤销一次编辑往往会导致纠错失效。这与大脑的丘脑‑皮层协同路由机制相呼应,暗示 PoLar 在一定程度上模拟了生物神经系统的灵活信息流动。

代码已公开发布于 https://datexis.github.io/RE-PoLar/。

点评

原文链接: https://arxiv.org/abs/2609.31360

[h] 返回首页