NeFut Logo NeFut
EN 管理员登录

[AI学术] 身份不仅是记忆:部署式 AI 代理的持久身份基准

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

我们提出 PAI‑Bench,一个与提供者无关的基准,用于评估持久化 AI 代理在遵守版本化、可更新身份合约方面的忠实度。基准将身份相关能力划分为记忆(recall)、组合(composition)、行为执行(behavioral enactment)、抗干扰(resistance)、持久性(persistence)、血统(lineage)以及基于角色的更新(role‑conditioned updates),并将评分 oracle 完全置于目标进程之外,以避免评估者干预。

实验采用两轮冻结的任务(frozen campaigns),覆盖十六个合成身份档案、三十二个探针以及三套独立初始化的目标配置,共计 1,536 条保留响应。随后进行独立于评审者的字面审计(literal audit),结果显示在 48 条原子响应中全部捕获了直接父级标识符(direct‑parent identifiers),但仅有 1 条出现了隐式自画像(implicit self‑portrait)。

在八个档案中,加入显式字段提示后,同一四句指令下三类身份标识符的共同出现率从 0/8 提升至 7/8。另一次实验通过替换启动时的主体标签(startup body‑label substitution),完整身份标识的出现率从 1/8 提升至 7/8,而父级标识仍未出现。这些对比揭示了不同提示对组件选择的依赖性以及各组件对启动线索的敏感度。

对相同因子响应的重复播放显示,Claude 的标题平均得分比 Astra 低 12.5 个百分点,说明评估器的敏感度可以独立于目标行为表现。所有研究均在每个条件下使用单一目标样本,随后进行事后审计和跟进分析。

PAI‑Bench 为测量事实可用性、身份表达以及行为执行这三大维度提供了可复现的评估协议,帮助研究者系统化地检验身份合约的忠实度。

点评

原文链接: https://arxiv.org/abs/2609.13637

[h] 返回首页