最近的研究表明,自动化红队在标准AI安全基准上发现的漏洞更多、成本更低,有人因此认为人类评估者可以被取代。但这种比较只衡量了一件事,却得出另一种结论。
基准测试只评估攻击者在开发者预先设定的危害集合中搜索的彻底程度,未列入集合的危害对任何在该框架内的攻击者(无论自动还是人工)都是不可见的。这种盲点在学术密码学和临床药物试验中也曾出现——内部有效的评估对未被指向的群体保持沉默。
我们将AI安全中的这种盲点称为“威胁模型覆盖缺口”。在当前的开源权重模型中仍可观察到:非英语提示会触发英文基准未捕获的危害。
要弥合该缺口,需要让评估者的部署情境与开发者不同。其依据是方法论上的覆盖需求,而现有评估框架本身难以自行产生这种评估者。
点评