NeFut Logo NeFut
EN 管理员登录

[AI学术] 长期视野代理中的幽灵:跨回合被忽视安全约束的治理风险

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

长期视野代理正日益承担帮助人类解决复杂问题的角色。其延长的交互历史却带来了一个被低估的执行安全问题:在表面友好的交互条件下,代理可能执行违背数回合前设定的安全约束的动作。我们将此类失效模式称为跨回合被忽视安全约束的治理风险(GHOST),其后果可能是不可逆的损害。实验表明,GHOST 并非孤立事件,在 GPT‑5.5 上的出现率达到 11.5%。理论上,如果每个安全前缀的剩余条件违背风险下界形成不可求和序列,则几乎必然进入风险区。基于此洞见,我们提出 STAR‑Guard:一种两层防御机制,结合历史语义安全约束恢复与执行前审计。约束恢复层负责重新激活适用的安全约束,从而降低不安全提案的产生;确定性审计层阻止残余违背直接作用于环境。实验验证,在 GPT‑5.5 设置下,两层防御实现了零 GHOST 事件。

点评:GHOST 揭示了长期交互系统中安全约束的时序盲点,STAR‑Guard 的双层设计提供了可行的防护路径,为未来安全代理的构建指明了方向。

原文链接: https://arxiv.org/abs/2610.02664

[h] 返回首页