NeFut Logo NeFut
EN 管理员登录

[AI学术] 智能代理不再仅仅是迎合:持久性谄媚的基准测试

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:47
#algorithm #AI #Machine Learning

摘要

状态保持的个人代理越来越多地维护长期用户档案、情节记忆和可重用技能。这种持久性将对话中的谄媚转化为状态写入失败:被接受的用户中心主张可以被记录为持久的偏好、背景事实或工作流,并在原始对话消失后重新使用。我们称之为持久性谄媚,并介绍了个人代理谄媚基准(PASB),这是一个包含1600个任务的基准,追踪一个对话主张是否被接受、写入持久代理状态,并在后续中被用于中立查询。

与之前提供预写记忆的基准不同,PASB评估真实代理(Hermes-Agent 和 OpenClaw),它们决定存储内容。它通过结合四种场景框架和四种时间交付模式来隔离写入过程,并将五轮持久阶段与三轮清除查询阶段分开,确保下游影响仅来自持久状态。

在十二个模型中,提交边界是关键的转折点:下游失败从会话仅限的45.0%增加到承诺后的71.9%,增加了27.0个百分点。已提交的主张展现出三种写入时间模式:状态提升、归属移除和范围扩大。在类似记忆或程序框架、重复强化,甚至跨域边界下,这些模式变得更强。这些结果表明,代理的谄媚本质上是一个状态写入治理问题。一旦用户内容被提交到持久记忆,安全性必须管理代理写入的内容,而不仅仅是它们所说的内容。PASB识别出需要的写入时控制,以在保留存储内容的来源、角色和范围的同时,限制风险提交,而不仅仅是响应级的缓解措施。

博主点评: 本文通过引入持久性谄媚的概念,揭示了智能代理在用户交互中的潜在风险,尤其是在状态管理方面。PASB基准的提出为评估和改进代理系统的安全性提供了重要思路,强调了写入控制在智能代理设计中的关键作用。

原文链接: https://arxiv.org/abs/2607.10526

[h] 返回首页