NeFut Logo NeFut
EN 管理员登录

[AI学术] MCP 到 A2A 代理配置中的公共标签与逐字字段外泄:受控多模型研究

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

本研究评估了在模型上下文协议(MCP)工具使用和 Agent‑to‑Agent(A2A)委托分别安全属性时,未覆盖两者共同使用时的行为。我们在单一受控的 MCP‑to‑A2A 配置中测量了该行为:测试平台将真实模型主机通过本地 MCP 再进入本地 A2A 链路,生成有序事件轨迹并使用确定性规则(无 LLM 判决)进行评分,每次试验仅允许一次受限决策。

实验采用预先指定、冻结的三臂设计:每个 10 条记录场景分别出现带有 CONFIDENTIAL 标头、无标头以及 PUBLIC - OK TO SHARE 标头的版本,六个实质记录值在各臂之间字节完全相同,结果为这些值是否逐字出现在出站消息中。四种模型 × 3 臂 × 4 次重复共计 480 次试验;场景为泛化单元,报告 10 个场景层面的均值、中位数和符号计数,不提供 p 值或置信区间。

CONFIDENTIAL 与无标头的对比在所有模型中均呈现底层限制(两臂均接近零),因此无法证明机密标签缺乏保护作用。加入 PUBLIC - OK TO SHARE 标头后,相对于无标头基线出现了更高的逐字外泄,且表现强烈依赖模型:Claude Sonnet 5 的关联最为显著(public‑minus‑unlabeled 均值 +0.800,全部 10 场景均出现;主要受 Claude 是否转发的影响),一种 GPT‑5.6 级别表现为中等但仍受底层限制,另一种表现几乎为零,第三种则完全底层。需强调这仅是单一配置下的关联,不能视为因果或普遍效应。

代码、字节锁定的轨迹以及离线分析流水线已作为公共制品发布。

点评

原文链接: https://arxiv.org/abs/2609.01693

[h] 返回首页