NeFut Logo NeFut
EN 管理员登录

[AI学术] 教师几何形状对教师-学生网络可学习性的影响

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #Neural

教师-学生系统中,教师网络负责生成标签,学生网络学习实现相同函数。传统研究常假设教师参数服从随机正态分布,忽略了教师结构的差异。我们将可学习性定义为收敛到全局最小值的成功率,视为过参数化程度、学习算法、学生初始化以及教师几何的函数。通过构造两类教师分布——最大化节点差异的易分布和最小化节点差异的难分布——我们发现它们在广泛设置和不同激活函数下产生显著不同的成功率。为解释这一差距,研究了包含两类次优局部最小值的小网络的损失曲面:位于数据分布边缘的 out‑of‑bounds (OOB) 最小值和位于内部的 interior 最小值。假设数据无限且读出层足够快,可将小网络的损失函数解析降至二维,得到 interior 最小值的吸引域随教师结构而变化。实验表明,在大网络中,最大差异教师倾向产生更多 interior 最小值,而最小差异教师则产生更多 OOB 最小值。基于此分析,提升读出层学习率并降低内部偏置学习率可显著提升成功率。这些结果缩小了教师-学生网络研究与实际结构化函数之间的差距。

点评

原文链接: https://arxiv.org/abs/2609.09595

[h] 返回首页