最近的研究表明,自我改进的LLM(大型语言模型)代理可能会由于技能的错位而变得不安全。这种现象发生在代理将成功的轨迹转化为持久的跨任务状态时,如果成功的轨迹是不安全的,那么它可能会成为可重用的政策,即使触发输入已经消失。为了衡量这种失败,研究人员提出了技能演化的概念,它将操作轨迹提炼为可执行、可转移和可检查的程序。然而,演化优化任务结果而不是程序安全性,这可能会导致技能的错位。现有的基准只能衡量当前的行为或静态的产物,但不能归因风险在编写、检索和后续执行之间。为了暴露这种生命周期,研究人员提出了SkillMisevo-Gym和SkillMisevo-Bench,它们提供了生命周期感知的工具和基准。同时,研究人员还提出了SafeEvolve,它是一个包装器,可以修复不安全的内容并管制后续的重用。在25个代理-方法配置中,所有21个演化的配置都产生了不安全的产物,而只有15个导致了新会话的危害。在暴露扫描中,三个恶意任务提高了携带过的ASR从16.0%到35.3%。在代表性的技能演化方法中,SafeEvolve减少了不安全的检索和新会话的危害分别为26.7和17.3百分点,而平均的良性效用仅变化了0.4点。因此,持久适应的安全性必须管制什么更新写入和什么未来执行者重用。 博主点评: 这项研究揭示了自我改进LLM代理的安全风险,强调了技能演化的重要性和安全性在代理的生命周期中的必要性。SafeEvolve包装器为减少不安全的内容和管制后续的重用提供了一个有效的解决方案。