NeFut Logo NeFut
EN 管理员登录

[AI学术] 哪些 Token 应该被 SFT 学习?基于 Token 修剪的数学推理视角

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

Supervised fine‑tuning(SFT)对所有目标 token 使用统一的交叉熵损失,然而在数学推理中不同 token 的学习信号并不等价。统一的处理会使已经掌握的 token 过度锐化,同时把学习压力放在不确定、低置信度的 token 上,导致训练动态次优。为此我们提出 Trimmed Logit‑Gap SFT(TrimSFT),一种基于 token 级别重新加权的简单方法。TrimSFT 根据 gold token 与其最强竞争者之间的 logits 差距(logit gap)对 SFT 损失进行缩放。该方法在两端都削减监督:对 logits 差距大的已掌握 token 和对差距小或为负的弱支持 token 都降低权重,学习重点集中在中间的 logit‑gap 区间。我们用一个以 margin m 为中心、带宽 τ 的高斯权重实现该原则,无需参考模型或额外前向传播。实验在 Llama、Qwen、DeepMath 系列的六个基模型上,覆盖五个数学推理基准。TrimSFT 在除一个模型外的全部模型上均优于标准 SFT,五个模型的平均性能最高,MATH500 上最高提升 26.9 分。进一步分析表明,带宽 τ 的影响大于 margin 的具体位置;仅在单侧削减监督的 half‑trim 变体表现较差。对 token‑level logit‑gap 分布的分析显示,TrimSFT 相比均匀 SFT 或单调加权方法,使模型置信度更平衡。结果表明,推理 SFT 通过同时削减两端的监督而非对所有 token 一视同仁,可获得更好效果。

点评

原文链接: https://arxiv.org/abs/2609.09707

[h] 返回首页