NeFut Logo NeFut
EN 管理员登录

[AI学术] 降低随机优化中的样本损害:新方法的突破

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#algorithm #Machine Learning #optimization

在现代优化器中,当前小批量的梯度与历史优化状态(如动量或自适应时刻)相结合,虽然效果显著,但这种聚合可能会导致个别样本的损失增加。我们将这一现象称为“损害”,并将参数更新形式化为一个优化问题,旨在明确最小化批量平均与过去优化状态对当前数据的冲突影响。由于精确的公式难以处理,我们引入了一种高效的代理方法。

首先,我们将问题的维度降低到批量大小,然后通过成功限制优化到最后一层线性层,从而大幅减少内存和速度瓶颈。这一发现出人意料,因为这层能够可靠地捕捉每个样本梯度的二阶统计特性。由此得到的代理问题可以轻松集成到标准优化器如 SGD 和 AdamW 中,并且可以通过少量适合 GPU 的迭代进行求解。关键是,该方法展现出良好的扩展性,随着模型规模或输入增大,相对计算开销会减少。实验结果表明,在图像分类基准测试中,减少了每个样本的干扰,并改善了模型的泛化能力。

博主点评: 本文提出了一种新颖的优化方法,强调了在随机优化中考虑样本间干扰的重要性。通过有效的降维和对关键层的关注,能够显著提升优化效果,尤其在大规模模型中展现出良好的可扩展性,具有广泛的应用前景。希望未来能看到更多针对优化问题的深入研究。

原文链接: https://arxiv.org/abs/2607.16261

[h] 返回首页