NeFut Logo NeFut
EN 管理员登录

[AI学术] 几何引导约束学习:提升LLM安全分类的革命性方法

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

在LLM隐藏空间中,安全性作为多面体(SaP)学习线性半空间约束,但需要针对每个类别调整约束数量K。我们展示了稀疏自编码器(SAE)特征提取能有效解决此问题:K=2在Qwen3.5-9B的12个类别中变得最优,在我们的BeaverTails分类基准上,每个类别的准确率达到了96-99%,大大减少了对全面搜索(K=4-25,随机初始化)的需求。这一收敛至两个平面的现象与线性表示假设一致,提供了安全边界在此设置下可以在SAE特征空间中用低维线性描述的有力证据。基于这一几何视角,我们引入了一个锥约束,其可学习的开口适应每个类别的聚类浓度,并通过三阶段训练进行稳定。

博主点评: 本文提出的几何引导约束学习方法,通过优化参数K,显著提升了LLM的安全性分类性能。这种方法不仅有效降低了复杂度,还为理解安全边界提供了新的几何视角,具有重要的理论和实际意义。未来的研究可以进一步探讨如何在更复杂的场景中应用这一方法。

原文链接: https://arxiv.org/abs/2607.19366

[h] 返回首页