LLM 驱动的智能体性能受基础模型和与环境交互时使用的 harness 双重影响,这会导致有害的最终回复和多步执行轨迹两类安全风险。现有的安全对齐方法要么依赖外部 harness 更新,要么只做策略优化,单独使用难以在运行时控制与内在安全之间建立桥梁。
SafeEvolve 提出一种基于经验的自演化框架,通过已完成的 on‑policy 轨迹中的安全经验,驱动 harness 与策略的持续共进化。
在 harness 端,SafeEvolve 将轨迹层面的安全证据转化为有界的组件级更新,覆盖安全提示和层次技能,实现可审计、可逆的 harness 工件。
在策略端,SafeEvolve 采用两阶段 SFT‑RL 流程:首先通过 harness‑use SFT 让策略学会利用进化后的 harness;随后在 harness 增强的 RL 中,引入 verifier‑decomposed 奖励,引导多步探索中的自主安全行为。
通过 harness‑policy 共进化,安全经验被转化为进化的运行时 harness 与更安全的策略行为。实验在多个智能体安全基准上表明,SafeEvolve 在安全‑效用权衡上优于现有基线。以 Qwen3.5‑4B 为例,SafeEvolve 在 AgentDojo 上实现了 $3\times$ 的 ASR(攻击成功率)下降,同时良性效用从 59.79% 提升至 61.86%。
点评