NeFut Logo NeFut
EN 管理员登录

[AI学术] SafeEvolve:基于代理经验的 Harness‑Policy 共进化实现安全对齐

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

LLM 驱动的智能体性能受基础模型和与环境交互时使用的 harness 双重影响,这会导致有害的最终回复和多步执行轨迹两类安全风险。现有的安全对齐方法要么依赖外部 harness 更新,要么只做策略优化,单独使用难以在运行时控制与内在安全之间建立桥梁。

SafeEvolve 提出一种基于经验的自演化框架,通过已完成的 on‑policy 轨迹中的安全经验,驱动 harness 与策略的持续共进化。

在 harness 端,SafeEvolve 将轨迹层面的安全证据转化为有界的组件级更新,覆盖安全提示和层次技能,实现可审计、可逆的 harness 工件。

在策略端,SafeEvolve 采用两阶段 SFT‑RL 流程:首先通过 harness‑use SFT 让策略学会利用进化后的 harness;随后在 harness 增强的 RL 中,引入 verifier‑decomposed 奖励,引导多步探索中的自主安全行为。

通过 harness‑policy 共进化,安全经验被转化为进化的运行时 harness 与更安全的策略行为。实验在多个智能体安全基准上表明,SafeEvolve 在安全‑效用权衡上优于现有基线。以 Qwen3.5‑4B 为例,SafeEvolve 在 AgentDojo 上实现了 $3\times$ 的 ASR(攻击成功率)下降,同时良性效用从 59.79% 提升至 61.86%。

点评

原文链接: https://arxiv.org/abs/2609.02786

[h] 返回首页