NeFut Logo NeFut
EN 管理员登录

[AI学术] dSTAR:容忍慢节点与拜占庭容错的分布式 SGD

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #optimization

分布式模型训练面临慢节点(straggler)和拜占庭攻击两大挑战。

为在多节点协同训练时保证梯度聚合的时效性和可靠性,本文提出了轻量高效的 dSTAR 方法。dSTAR 只收集最先响应的前 $k$ 个工作节点的梯度更新,并利用 集成中位数 计算每个梯度的偏差,对偏差超出阈值的更新进行过滤。该机制既削弱了慢节点的负面影响,又能抵御恶意节点的篡改。

理论上,dSTAR 被证明满足 $(\alpha, f)$‑拜占庭弹性,即在至多 $f$ 个拜占庭节点存在的情况下仍能保证梯度的可靠性,并实现线性收敛率。实验在多种攻击场景和网络延迟条件下进行,结果显示 dSTAR 在准确率上始终保持领先,攻击下的准确率下降不超过 5%,而其他拜占庭容错方法常出现 40%‑50% 的下降。

综上,dSTAR 为在存在慢节点和拜占庭故障的分布式环境中进行模型训练提供了一种稳健且高效的解决方案。

点评

原文链接: https://arxiv.org/abs/2412.07151

[h] 返回首页