NeFut Logo NeFut
EN 管理员登录

[AI学术] 潜在融合越狱:结合有害与无害表征以引发不安全的 LLM 输出

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #optimization

在大型语言模型(LLM)的安全对齐中,仍然可以通过白盒干预来操控其内部表征。我们提出了潜在融合越狱(LFJ)方法,该方法通过将有害查询与结构相似的无害查询配对,然后在精心选择的层和令牌位置上插值其隐藏状态来实现。拒绝损失梯度精确确定干预的位置,我们使用基于令牌归一化的合规性和拒绝抑制目标来优化逐层混合系数。编辑后的提示状态依次在其余的变换器块中传播。

在四个安全基准测试和五个开放权重目标模型中,LFJ 在我们描述的白盒协议下达到了 94.13% 的宏平均攻击成功率(ASR)。由于 LFJ 直接访问内部状态,因此与仅基于提示的攻击的比较仅作为描述性参考,而不是匹配评估。去掉拒绝采样使 ASR 降低到 86.72%,而将结构化的有害-无害配对替换为随机配对则使其降至 27.45%。

我们还设计了一种 LFJ 特定的潜在对抗训练程序,当攻击针对防御模型进行重新优化时,ASR 从 94.13% 降至 12.37%。此防御评估未涵盖对其他攻击类型的转移或无害效用的保持。

博主点评: 潜在融合越狱(LFJ)方法展示了对大型语言模型安全性的深刻挑战,通过巧妙的结构设计,攻击者能够以高效的方式操控模型输出。LFJ 的成功率令人震惊,尤其是在优化策略上显现出强大的适应性。这一研究为模型安全性和防御机制提供了新的视角,值得进一步关注和探讨。

原文链接: https://arxiv.org/abs/2508.10029

[h] 返回首页