摘要
Rotary Position Embedding (RoPE) 在 Transformers 中被广泛应用于编码位置相关信息,但标准实现强制所有注意力头采用统一的频率调度和缩放。通过简化的检索任务和长度泛化场景,我们的研究表明——无论是实证还是理论——具有不同功能角色的头需要不同的频率范围和注意力缩放因子才能有效运作。忽视这种结构会导致嵌入维度的利用不佳和性能下降,尤其是在长上下文设置下。
为了解决这些局限性,我们提出了 AdaRoPE,为每个注意力头提供可学习的旋转频率和注意力缩放因子。使用 AdaRoPE 预训练的 LLM 在性能上始终优于现有的 RoPE 变体,包括部分 RoPE 和 NoPE 基线。我们进一步展示,像 YaRN 等方法中使用的统一频率和注意力缩放并非最优。通过应用特定于头的缩放,AdaRoPE 实现了更好的上下文扩展,同时在外推设置和长上下文持续预训练设置中更好地保留了短上下文性能。这些结果强调了在单个注意力头级别优化旋转位置嵌入的重要性。
博主点评: AdaRoPE 的提出显著提高了 Transformer 模型在长上下文任务中的表现,尤其是在注意力机制的灵活性方面。通过为每个注意力头引入可学习的参数,AdaRoPE 使得模型能够更好地适应不同的上下文需求,这一创新思路为未来的预训练模型设计提供了新的方向。整体来看,该方法不仅提升了模型的表现,也为嵌入优化提供了新的视角。