NeFut Logo NeFut
EN 管理员登录

[AI学术] 异步点对点 Gossip 学习网络中知识蒸馏的收敛理论

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#algorithm #AI #Machine Learning

在去中心化、无服务器的学习场景中,设备往往采用不同的模型结构,传统的去中心化 SGD 需要对模型参数做平均,但参数维度不一致时该操作不可定义。知识蒸馏 (KD) 通过交换软预测而非权重,天然绕过了这一限制。然而,针对完全去中心化、异步点对点 (P2P) KD 的收敛理论尚未建立。本文将共识从参数空间迁移到函数(输出)空间:一次 KD 交互在对数几率空间上表现为对同行预测分布的几何收缩算子,我们在参考测度上的预测 Hilbert 空间中对其进行分析。 在标准的光滑性/方差假设以及两条可实现性假设(第一条将参数 SGD 与函数步对应,第二条控制任务/KD 的受限对齐)下,时间平均的函数站稳性和函数空间不一致性以 $O\bigl(1/(\eta T)\bigr)$ 的速率收敛到 $O(\eta)+O(B_f^2)+O(\zeta_f^2)$ 的邻域。 其中 $B_f$ 表示任务最优解到各节点可达模型类的距离,$\zeta_f$ 衡量持续的本地任务异质性。 实验在同构、宽度异构以及混合族网络上进行,KD 将函数不一致性压缩了 $40\sim61$ 倍,而单独训练则没有此效应。 采样得到的站稳性诊断在共享骨架的主实验中呈现后期指数 $0.99\sim1.90$,四点步长扫描展示了理论预测的瞬态行为:邻域大小的权衡。

点评

原文链接: https://arxiv.org/abs/2609.01952

[h] 返回首页