NeFut Logo NeFut
EN 管理员登录

[AI学术] HASTE:利用稀疏证据进化代理安全约束

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

代理安全约束在防御体系中负责约束行为,防止出现危险操作。随着新型攻击快速出现,人工调整约束的速度难以跟上,迫切需要自动化的进化机制。\ \ HASTE 是一个多代理框架,核心由安全规范生成器和攻击案例生成器组成。安全规范生成器依据稀疏的威胁证据(如简短描述或少量攻击示例)提炼安全约束;攻击案例生成器在每轮更新后尝试触发未被覆盖的安全漏洞。两者通过对抗式交互不断迭代,评估结果同时反馈给两条生成路径,使约束能够超越最初的证据范围进行自适应演化。\ \ 具体流程如下:\

  1. 从威胁报告抽取关键描述或示例;\
  2. 安全规范生成器输出约束规则;\
  3. 攻击案例生成器基于当前约束搜索潜在攻击;\
  4. 评估攻击成功率并将结果回传,指导下一轮规范和案例的生成。\ \ 实验在多种主干模型、不同攻击类型以及多种证据形式下进行。结果显示,HASTE 能持续降低攻击成功率,同时保持对正常任务的效用基本不变。\ \ 代码已公开于 https://github.com/xxiqiao/HASTE。\ \ 点评
原文链接: https://arxiv.org/abs/2610.02920

[h] 返回首页