在监狱逃生的鲁棒性研究中,通常通过LLM作为评判者的方法来评估安全性。然而,这种评估对基准评分过程敏感,仅能捕捉到在特定攻击下观察到的行为,无法直接揭示潜在安全机制的脆弱性。
本文提出了JADR(危险识别的雅可比评估)协议,通过雅可比空间(J-space,一个最近提出的可言语化概念工作空间)来测量模型的内部表征,在生成第一个响应标记之前。对于每个提示和层,我们记录前k个J空间标记,这些标记被分为六个行为场景轴,并在基于StrongREJECT的危险样本与从XSTest和OKTest中提取的安全控制之间进行比较。
该方法不依赖于外部评判模型:计算完全在被评估模型的激活上运行,这使我们能够在相同条件下比较不同模型以及单一模型的修改——特别是量化和微调。最终比较基于提出的SafetyAUC指标,并辅以自助置信区间。
该协议应用于六个模型(Qwen3-1.7B, Qwen3-4B, Qwen3-8B, Qwen3-Uncensored-4B, Qwen3-SafeRL-4B, Gemma 2 9B)在三种权重表示方式下——BF16、INT8和INT4,并与使用StrongREJECT评估的独立行为评估进行了检查。该指标在统计上显著区分具有强内部安全机制与弱内部安全机制的模型,并捕捉到量化级别之间的实质性差异效果。
博主点评: 本文提出的JADR协议通过量化模型的内部表征,提供了一种新的评估安全性的方式,尤其在不同量化水平下的模型比较上具有重要意义。这种方法不仅增强了对模型脆弱性的理解,还为未来的安全性评估提供了新的研究方向。整体而言,这一研究展示了如何在不依赖外部模型的情况下有效评估和比较不同模型的安全性。