NeFut Logo NeFut
EN 管理员登录

[AI学术] 利用大型语言模型代理进行概念抹除的压力测试

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #Open Source

摘要

概念抹除旨在从训练好的生成模型中移除语义概念,对于负责任的人工智能部署日益重要。然而,验证模型是否已稳健地移除目标概念仍然是一个关键挑战。现有的评估方法通常是预定义和静态的,未能在多样的自然语言探测和挑战条件下暴露出脆弱性。此外,手动设计的评估策略可能存在偏见且难以扩展。

我们认为,概念抹除的评估最好被表述为自适应假设搜索,由代理迭代性地提出、批判和验证测试,以系统性地扩展失效模式的覆盖范围。为此,我们提出了概念抹除压力测试代理(STACE)框架,该框架使用多个大型语言模型(LLM)代理自主地对概念抹除模型进行压力测试,通过迭代生成和验证基于外部知识的压力测试假设。

我们还引入了一套指标来评估LLM代理驱动的压力测试框架的性能和效率。我们的广泛实验表明,STACE在四个概念类别上优于五个基于LLM的评估基线。进一步分析涵盖两个T2I模型、六种概念抹除方法和各种抹除强度,表明STACE在不同设置下表现稳健。我们还展示了STACE可以超越概念抹除评估,适应于其他问题领域,如LLM越狱。

我们的代码可匿名获取。

博主点评: 该研究通过引入STACE框架,推动了概念抹除的验证方法,强调了自适应假设搜索的重要性。这一创新方法不仅提高了评估的灵活性和有效性,同时为未来的AI安全性研究提供了新思路。特别是其在多种模型和方法上的适应性,显示了其广泛的应用潜力。

原文链接: https://arxiv.org/abs/2607.17890

[h] 返回首页