摘要
当前对大型语言模型的越狱攻击评估存在不一致的标准和方法,导致攻击成功率的估计不可靠。我们提出了JailMeter,这是一种基于证据的评估框架,旨在更准确地测量越狱效果。
JailMeter的设计
JailMeter受到信息瓶颈理论的启发,应用双重反馈优化来过滤模型响应中的越狱噪声,同时保留与原始恶意问题相关的内容。这个过程生成了简明的证据,从而进行严格的评估,只有当响应捕获到恶意意图并提供完整答案时,攻击才被验证有效,表明成功绕过了模型的安全对齐。
实验评估
我们在JailMeter-Eva上评估了JailMeter,这是一个包含330个人工标记且未被拒绝的越狱实例的挑战性基准。JailMeter的准确率达到97.27%,显著优于现有的评估方法。
小型语言模型
为了支持大规模评估,我们进一步将JailMeter提炼为一个小型语言模型JailMeter_SLM,该模型在大幅降低计算成本的同时保持了相当的可靠性。
代码和数据集可在 GitHub 获取。
博主点评: JailMeter的提出为评估大型语言模型的安全性提供了更为严谨和系统的方法,其高准确率和小型模型的设计展现了在保证评估可靠性的同时,优化计算资源的潜力。未来的研究可以探索如何进一步提升其在多样化攻击场景下的适应性。