NeFut Logo NeFut
EN 管理员登录

[AI学术] 可信的代理式 AI:失效模式、缓解策略与自主 LLM 系统生命周期框架

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

代理式 AI 基于大语言模型,能够进行多步规划、调用外部工具、在记忆中保留信息并与其他代理协作。这些能力提升了实用性,却也带来安全与运营风险,例如来自网站、邮件、文档和数据库的未受信任内容可能混入系统指令,持久记忆会在会话间传播受污染信息,工具访问会把错误响应转化为真实行动。

可信性可以从安全鲁棒、对齐与人工监督、透明与可审计、隐私与数据治理、监管合规五个维度来评估。

失效模式被归纳为间接提示注入、后门触发、目标误概化、记忆污染、跨会话数据泄漏等。

主要缓解手段包括指令层级、上下文隔离、聚焦、过程监督、受限工具使用以及隐私保护记忆。文中区分了已有实证支持的技术和仍属概念阶段的方案。

在此基础上提出可信代理开发生命周期(TADL),涵盖规格、设计、训练、评估、部署、监控六个阶段。每一阶段明确相应的信任活动、预期证据和基于风险的决策门。

虽然 TADL 尚未完成实证验证,但为构建更安全、可问责的代理系统提供了结构化框架。文章最后指出当前基准的不足并提出未来研究的重点。

点评

原文链接: https://arxiv.org/abs/2609.22712

[h] 返回首页