摘要
基础模型的安全基准反映了其发布时的AI风险。随着模型的进步和政府出台新的AI安全立法,这些风险分类变得不完整,攻击提示也变得无效。我们推出了AIR-BENCH Live,这是AIR-BENCH 2024的自我进化继任者。
一个自动更新管道监控政府法规,并根据当前的四层风险分类对新政策进行分类,既可以将其匹配到现有类别,也可以提出新的细化类别。然后,采用多智能体、基于角色的提示生成算法,以最小的人为审查生成现实且多语言的提示,留出改进现代越狱技术的空间。该算法用于彻底改造遗留提示,并为新类别生成提示。
在我们当前的版本中,基准从314个细化风险扩展到335个,21个新类别源于七个司法管辖区内31条真正新颖的政策条款。评估14个近期模型后,我们发现模型在其自身行为上的安全性差异较大(从0.17到0.89),现代化的提示平均比2024版本难度高出0.06分,最大降幅集中在最合规的模型上,并且大多数模型在非英语提示上的安全性略有下降。通过不断吸收新法规和再生提示,AIR-BENCH Live旨在与快速发展的领域共同演进。
博主点评: AIR-BENCH Live的创新在于其自动化更新能力,能够持续适应不断变化的AI安全法规。这种自我进化的基准不仅提升了安全评估的准确性,也为模型的改进提供了新的方向,体现了AI治理与技术发展的紧密结合。未来,如何平衡安全与创新将是一个重要挑战。