摘要
长效AI代理在部署后不断演化,保留经验、获取技能和工具、修订工作流程、委派任务并跨越任务阶段。这种适应性提升了代理的能力,但也带来了独特的授权问题。工具驱动的代理可能将模型错误和提示注入转化为重要的外部行为;当在活跃授权下发生演变时,行使该授权的主体或其行为的环境可能与用户评估时不再匹配。
演变可能改变在旧授权下可达到的效果以及任务所需的授权,这种授权可能会增加、减少或变得不可比较。现有的工具政策虽然限制了行为,但并未明确何时授权仍然有效。我们提出了授权连续性的问题:现有授权何时仍然有效,主动权如何变化,以及什么边界绝不能移动?
我们的状态边界模型在授权时固定了转变范围和不可变效果上限。该范围决定了授权是否能在变异中存活;在上限以下,授权可以自由收缩,只有在特定证据条件下才能扩展。我们区分请求的效果与实现的效果,并证明在完全调解、合理的效果抽象、衰减的委派和监控完整性下,变异不会将受保护的效果放大到用户设定的上限。
代理生成的证据可以在上限以下分配授权,但无法提升上限。最后,我们将六种变异类别映射到其授权后果。
博主点评: 本文探讨了长效AI代理在演变过程中的授权问题,提出了授权连续性的重要性,揭示了在动态环境中维护安全与控制的复杂性,具有重要的理论与实际意义。对未来AI系统的设计和管理提供了深刻的启示。