NeFut Logo NeFut
EN 管理员登录

[AI学术] 频率并非灵敏度:在稀疏 MoE 大语言模型中识别安全敏感专家

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

抑制少量被路由的专家会在不重新训练的情况下削弱稀疏混合专家(MoE)语言模型的安全行为。\ 因此,哪些专家需要被抑制成为安全问题。传统做法依据激活频率,但频率衡量的是使用次数,而非影响力。\ 本文测试一种替代指标——路由梯度灵敏度,即序列损失对选择专家的门权重的敏感度。\ 我们在五种 MoE 架构上,对 500 条良性提示和 500 条恶意提示进行专家排序,并在两种预算约束下(等专家数量、等恶意路由流量 1%‑5%)评估对 100 条未见恶意提示的拒绝率。\ 在所有 25 种条件中,路由梯度选择在 24 条条件下比激活频率更能降低拒绝率,并且在全部 25 条条件下均优于十次随机平均。\ 效果最显著的是 OLMoE,拒绝率从 34/100 降至 9/100(相对下降 73.53%),且生成质量未受影响,表明是实质性合规而非生成崩溃。\ 即使在每层匹配专家数量后,梯度选择仍在 23/25 条条件下优于激活频率(两条持平)。\ 跨模型的探索性分析显示,恶意‑良性集中度差距越大,峰值梯度效应越强(ρ = 0.90,双侧 p = 0.083,n = 5)。\ 综上,实验结果在所设预算下支持使用路由梯度灵敏度进行专家抑制。\ \ 点评:路由梯度提供了比单纯使用激活频率更具因果解释力的安全控制手段,尤其在高风险场景下能够显著提升模型的拒绝能力而不牺牲生成质量。

原文链接: https://arxiv.org/abs/2610.02910

[h] 返回首页