现有的针对扩散式大语言模型(dLLM)的攻击和防御往往只针对特定漏洞,缺乏统一的解释框架。我们将安全对齐视为对去噪能量景观的塑形:一个对齐良好的模型会在安全输出与有害输出之间形成能量屏障,将有害查询引导至安全区域。\ \ 当前的越狱攻击本质上是两类绕过屏障的策略:一是隐藏查询的安全属性,使其在初始化阶段不被识别;二是沿生成轨迹中途干预,强行让去噪路径跨越能量屏障。\ \ 基于已知的掩码扩散模型在去噪过程中最小化动能 $E_k$ 的性质,我们提出了三种互补、无需额外训练的检测信号:\
- 步骤0比例(step‑0 ratio),通过生成前的 logits 分布直接读取查询的安全倾向;\
- 两个轨迹速度信号,分别在 logits 空间的互补子空间中跟踪动能变化。\ \ 攻击要么在初始化时暴露意图,被步骤0比例捕获;要么在跨越屏障时消耗动能,在至少一个子空间的速度信号中留下痕迹。因此,这三种信号在能量预算上相互覆盖,天然弥补盲点。\ \ 我们在三种密集 dLLM(LLaDA‑8B、LLaDA‑1.5、Dream‑7B)和一种稀疏混合专家 dLLM(LLaDA‑MoE‑7B)上进行评估,实验验证了信号的互补性。压力测试已知攻击时,所有逃过检测的配置均未生成有害内容,说明检测阈值与跨越屏障的能量阈值难以分离。\ \ 点评:该工作通过能量景观提供了统一视角,解释了越狱攻击的根本机制,并提出了基于动能的轻量检测方案,实验结果显示在多模型上具备稳健性,为 dLLM 的安全防护提供了新思路。