我们在同一批问题上分别使用两套互不兼容但都正确的约定进行训练,观察数据的排列顺序如何写入模型参数。学习率调度不再是背景条件,而是决定答案的平均算子。我们证明了一个上界,其中排列和调度以乘积形式出现:
$$E = B \cdot w$$
其中 $B$ 表示排列的块期(block period),$w$ 表示调度在任意时刻对最终参数的权重。衰减调度无法在同一时刻同时拥有大步长和未收缩的余量;而恒定调度在最后一步正好满足此条件。
实验中固定语料、预算和路径,仅在学习率调度类型上做两组对比:
- 常数速率:内部分配跨度 $0.2221$,对比度 $11.63$,随排列阻塞程度单调变化。
- 单余弦调度(所有已发表工作常用):同样的十种排列分布在两个可区分的状态,而理论上它们的分辨率足以区分约十个状态。
这表明“顺序重要”和“顺序不重要”其实是同一旋钮的两端。路径写入的内容决定模型承诺的约定,而任何精确匹配的基准都无法检测到这一点。实验显示,十二条臂的 $\text{acc}_A+\text{acc}_B$ 变化不超过 $9.7\%$,而分配比例在 $0.04$ 到 $0.87$ 之间波动,说明本文测得的 $12.29\sigma$ 排列切换在无约定度量下恰为零。将约定显式写入提示后,切换被压缩,性能可达联合上限的 $87.5\%$。
点评:本文通过理论分解与受控实验,揭示了学习率调度在跨约定学习中的核心作用,并提供了可复现的度量方法,为理解模型对数据顺序的敏感性提供了新视角。