NeFut Logo NeFut
EN 管理员登录

[AI学术] CART:大语言模型的闭环自适应红队测试

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

CART(闭环自适应红队测试)是一种利用每次测试结果来指导后续探测的框架。它首先覆盖广泛风险,然后跟随出现的弱点,保持新探针的多样性,并记录每个发现的证据和来源。框架将角色分为挑战者(生成测试)、目标(被测模型或受限工具使用代理)和评审者(判断结果),从而可以独立研究各角色。

在三个评估族(Frontier、JAH、Agentic)中,CART 相比静态种子重放发现了更多失败并提升了平均风险,所有有基线的目标均表现出优势。该优势同样出现在工具介导的代理测试中,说明上下文适应能够揭示直接提示重放未触及的弱点。结果描述的是测试策略能发现的缺陷,而非真实部署中失败的频率。实验还表明,挑战者与评审者的组合会影响揭示的证据,凸显角色分离和独立审查的必要性。

总体而言,CART 将红队测试从一次性清单转变为持续、适应性和可审计的模型与代理弱点搜索。

点评

原文链接: https://arxiv.org/abs/2609.27336

[h] 返回首页