在推理的测试阶段,模型会产生多个 rollout 形成 cohort,但缺乏一种无需标签即可描述其内部计算如何随推理展开而重组的方法。我们提出 路由有效秩($d_{\text{eff}}$),它是基于 MoE 专家路由相似性构建的跨 rollout 图的熵有效维度。\
在十种 MoE 配置和五个数学/科学基准上,$d_{\text{eff}}$ 展现出可复现的低‑高‑低轨迹:98.5%(3,105 组)cohort 在中间预算处出现显著峰值,表现为早期路由相似度集中、随后在中等预算时分化最强、再到后期重新集中。峰值出现的时机随模型结构和推理努力系统性变化。\
我们进一步将轨迹精确分解为 共同模态质量 与 残差谱维度 两部分。共同模态的重新分配约解释了轨迹的三分之二,残差谱贡献约四分之一,并在共同模态之外保留显著变异。\
在非全体一致的 cohort 中,公共模态浓度的提升强烈预测相同答案的可恢复性。更高的推理努力会将峰值延迟 $2.59$ 个八度(即 token 预算加倍 $2^{2.59}\approx6$ 倍),并在所有四种架构上显著延长高秩阶段的持续时间——效果体现在峰值出现的时机和持续时长,而非峰值幅度本身。\
通过正确性比较,我们将结构监控与答案选择分离,使路由有效秩成为一种可分解、无需标签的 cohort 组织诊断工具,为 MoE 推理群体在推理过程中的分化与再集中提供了原理性的谱视角。\
点评