代理式 AI 基于大语言模型,能够进行多步规划、调用外部工具、在记忆中保留信息并与其他代理协作。这些能力提升了实用性,却也带来安全与运营风险,例如来自网站、邮件、文档和数据库的未受信任内容可能混入系统指令,持久记忆会在会话间传播受污染信息,工具访问会把错误响应转化为真实行动。
可信性可以从安全鲁棒、对齐与人工监督、透明与可审计、隐私与数据治理、监管合规五个维度来评估。
失效模式被归纳为间接提示注入、后门触发、目标误概化、记忆污染、跨会话数据泄漏等。
主要缓解手段包括指令层级、上下文隔离、聚焦、过程监督、受限工具使用以及隐私保护记忆。文中区分了已有实证支持的技术和仍属概念阶段的方案。
在此基础上提出可信代理开发生命周期(TADL),涵盖规格、设计、训练、评估、部署、监控六个阶段。每一阶段明确相应的信任活动、预期证据和基于风险的决策门。
虽然 TADL 尚未完成实证验证,但为构建更安全、可问责的代理系统提供了结构化框架。文章最后指出当前基准的不足并提出未来研究的重点。
点评