LLM 的推理通常采用固定深度、固定顺序的前向传播,即每个输入都会依次经过所有层。人脑并非如此:它通过丘脑作为枢纽,根据需求灵活地将信息路由到皮层的不同区域。Li 等人(2026)提出的 program‑of‑layers (PoLar) 将 Transformer 的层视作函数库,而非固定序列,从而实现类似的人脑路由机制。PoLar 会根据输入动态选择跳过或重复连续的层块,形成自适应的层程序。
我们在 5 种模型上复现了 PoLar 的诊断性 MCTS(蒙特卡罗树搜索),并验证了原文的几项关键结论:
- 跳过层块的程序优于标准前向传播;
- 重复层块的程序优于仅跳过的程序;
- 同时使用跳过和重复的组合程序表现最佳。
实验还显示,简单问题只需较短的程序即可解决,而难题往往需要更多的层重复。值得注意的是,我们未能复现作者关于单次推理路由器的核心声明:该路由器的最高预测始终退化为标准前向传播,尽管其 top‑k 程序集合整体上仍能提升准确率。
进一步分析表明,少量通用程序已经足以覆盖大多数问题。我们对这些程序的结构和鲁棒性进行了深入探讨,发现用于纠错的程序极其脆弱——在程序内部撤销一次编辑往往会导致纠错失效。这与大脑的丘脑‑皮层协同路由机制相呼应,暗示 PoLar 在一定程度上模拟了生物神经系统的灵活信息流动。
代码已公开发布于 https://datexis.github.io/RE-PoLar/。
点评