NeFut Logo NeFut
EN 管理员登录

[AI学术] SAGE:高影响生成AI的安全优先防御机制与生命周期控制

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Open Source

摘要

高影响生成AI的潜在灾难性误用已成为生命周期控制问题,而不仅仅是提示过滤问题。SAGE是一种安全优先、授权分离的架构,在考虑效用、延迟或商业目标之前,可信的灾难性启用风险限制了可接受性。它结合了签名发布清单、各种检测器、稳健的风险包、最小风险默认、输出检查、三值监控、受保护的审计链、隔离和回滚。

正式结果建立了安全优先、保守的检测器界限、单调发布门控、抗篡改记录以及授权切割;两个PRISM抽象验证了在明确假设下的授权分离和生命周期不变性。一个冻结的、供应商对称的研究将84个案例发送到四个GPT、四个Claude和两个Gemini快照:840次调用产生了794个目标响应,46个提供者错误,以及覆盖375个响应的449个成功判断。八个快照实现了完整的判断领域覆盖。

有害合规估计较低,变化主要源于良性效用和安全重定向。涉及Claude、Gemini或GPT-5快照以及GPT-5 mini和GPT-5 nano快照的七个多重调整对比得到了支持,而Claude或Gemini快照与GPT-5或GPT-5.5之间的任何测试对比均未通过校正。观察到的有害合规范围是基于无工具、检索、历史或人工裁定的每个提示一代的保守协议界限视图,并非操作协助的上限。一个预注册的扩展指定了如何使用锁定分割、重复采样、多轮和沙盒工具条件以及领域专家评分来测试更广泛的最佳-最差差距。

博主点评: SAGE架构通过多层次的安全机制有效应对生成AI的风险,强调了授权分离的重要性。这一方法不仅关注模型的输出,还考虑了整个生命周期的安全性,为未来的AI应用提供了重要的理论支持和实践指导。其在高风险场景下的适用性和有效性值得关注和进一步研究。

原文链接: https://arxiv.org/abs/2607.22926

[h] 返回首页