代理安全约束在防御体系中负责约束行为,防止出现危险操作。随着新型攻击快速出现,人工调整约束的速度难以跟上,迫切需要自动化的进化机制。\ \ HASTE 是一个多代理框架,核心由安全规范生成器和攻击案例生成器组成。安全规范生成器依据稀疏的威胁证据(如简短描述或少量攻击示例)提炼安全约束;攻击案例生成器在每轮更新后尝试触发未被覆盖的安全漏洞。两者通过对抗式交互不断迭代,评估结果同时反馈给两条生成路径,使约束能够超越最初的证据范围进行自适应演化。\ \ 具体流程如下:\
- 从威胁报告抽取关键描述或示例;\
- 安全规范生成器输出约束规则;\
- 攻击案例生成器基于当前约束搜索潜在攻击;\
- 评估攻击成功率并将结果回传,指导下一轮规范和案例的生成。\ \ 实验在多种主干模型、不同攻击类型以及多种证据形式下进行。结果显示,HASTE 能持续降低攻击成功率,同时保持对正常任务的效用基本不变。\ \ 代码已公开于 https://github.com/xxiqiao/HASTE。\ \ 点评