NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性长序列精调技术:有限显存下的高效训练

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

摘要

参数高效的精调方法降低了模型和优化器的内存需求,但密集注意力仍使得长训练序列的开销巨大。我们结合了分层全局注意力(HGA)、分段反向传播和分层KV存储。只有活跃的段保持可微分状态在VRAM中;较旧的KV被转移到RAM或NVMe中,而HGA为每个查询块加载一定数量的精确历史令牌。

在使用4位QLoRA和PG19的Qwen3-8B模型上,16GB的Quadro RTX 5000显卡进行密集训练时,能够处理2048个令牌,但在4096个时失败,而HGA则可以达到16384个令牌,峰值VRAM使用15.28GB。在评估中,同样的适配器在该显卡上可以处理131072个令牌;VRAM并非恒定,而是随着驻留块摘要的增加而缓慢增长,因此RAM和NVMe的容量设定了这些长度的实际限制。

在共享的2000个训练长度下,HGA训练的适配器和密集训练的适配器在同样的密集注意力读取下分别获得了2.7405和2.7383 nat,而标准模型则获得了2.9541。在这个边界上,HGA训练已经略微更快(217.75 vs. 207.02 tokens/s),而HGA与密集训练的吞吐比从1000提升至2000;因为HGA保持了每个令牌的历史集的关注量大致恒定,而密集计算每个令牌的工作量在增加,我们预计随着上下文的增长,这种优势将进一步扩大。密集注意力用于主要的质量和检索比较,以确保它们测量学习到的权重并与标准生成框架兼容。HGA也可以用于检索和生成;一个优化的生产级服务实现正在开发中。

博主点评: 这项研究展示了如何在显存受限的情况下,通过创新的分层全局注意力机制和分段反向传播技术,显著提高长序列模型的训练效率。HGA的应用不仅扩展了可处理的上下文长度,还在训练速度上展现出潜力,为大规模语言模型的实际应用提供了新的思路。

原文链接: https://arxiv.org/abs/2607.15105

[h] 返回首页