从被动的基础模型向具备递归认知推理环、持久记忆、实时工具执行和平面以及多智能体协作的自主智能体转变,带来了前所未有的能力。与此同时,赋予概率神经核心对文件系统、网络和云基础设施的执行权限,打破了传统安全边界:自然语言既是输入数据,又是内部控制代码和通信协议,使未受信任的数据等同于可执行指令,形成图灵完备的攻击面。本文综述了206篇关键研究和监管标准,构建了可信任智能体的系统安全参考框架。我们将通用智能体模型形式化为有状态的5元组 $(S, A, M, T, P)$,并提出覆盖安全、可靠性、隐私、可解释性、公平性和问责性的6维可信度分类。针对内部执行环和交互平面的威胁面进行系统化分析,提出多层零信任防御深度架构,核心包括双LLM隔离、基于能力的访问控制、内核 eBPF 探针和沙箱运行时。随后回顾了标准化评估基准,并将技术控制映射到国际AI治理框架。
点评