NeFut Logo NeFut
EN 管理员登录

[AI学术] 代理记忆是内源授权洗钱的薄弱环节

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

长期运行的 LLM 代理依赖持久记忆在交互之间保持状态,包括权限、限制和撤销。当记忆对这些随时间变化的授权状态描述不准确时,代理自身的记录可能授予本不存在的权力,导致行为偏离而无需外部攻击。我们将这种现象称为内源授权洗钱,即错误的权限写入记忆后,其来源被抹去,进而触发未授权操作。为此我们提出 EAL‑Bench,用于评估持久记忆在演进授权状态下的保真度以及错误是否会传播到后续的未授权行为。实验中选取五种 LLM 作为记忆写入者,两个模型作为执行者,覆盖采购、网络安全和金融三大场景。结果显示,在增量记忆更新下,写入者会为高达 50.2% 的未授权请求产生虚假授权;一旦出现虚假授权,执行者在 98.6% 的试验中会依据其行动。我们测试了两种防护措施:要求存储的权限必须有有效来源事件作为支撑,以及通过有界事件溯源追踪权限变更。两者均显著降低了洗钱现象,但也导致更多合法操作被拒绝,暴露出安全与效用之间的权衡。由此可见,持久记忆不仅是性能组件,更是 LLM 代理实际授权策略的关键组成部分。

点评

原文链接: https://arxiv.org/abs/2609.01836

[h] 返回首页