本研究评估了在模型上下文协议(MCP)工具使用和 Agent‑to‑Agent(A2A)委托分别安全属性时,未覆盖两者共同使用时的行为。我们在单一受控的 MCP‑to‑A2A 配置中测量了该行为:测试平台将真实模型主机通过本地 MCP 再进入本地 A2A 链路,生成有序事件轨迹并使用确定性规则(无 LLM 判决)进行评分,每次试验仅允许一次受限决策。
实验采用预先指定、冻结的三臂设计:每个 10 条记录场景分别出现带有 CONFIDENTIAL 标头、无标头以及 PUBLIC - OK TO SHARE 标头的版本,六个实质记录值在各臂之间字节完全相同,结果为这些值是否逐字出现在出站消息中。四种模型 × 3 臂 × 4 次重复共计 480 次试验;场景为泛化单元,报告 10 个场景层面的均值、中位数和符号计数,不提供 p 值或置信区间。
CONFIDENTIAL 与无标头的对比在所有模型中均呈现底层限制(两臂均接近零),因此无法证明机密标签缺乏保护作用。加入 PUBLIC - OK TO SHARE 标头后,相对于无标头基线出现了更高的逐字外泄,且表现强烈依赖模型:Claude Sonnet 5 的关联最为显著(public‑minus‑unlabeled 均值 +0.800,全部 10 场景均出现;主要受 Claude 是否转发的影响),一种 GPT‑5.6 级别表现为中等但仍受底层限制,另一种表现几乎为零,第三种则完全底层。需强调这仅是单一配置下的关联,不能视为因果或普遍效应。
代码、字节锁定的轨迹以及离线分析流水线已作为公共制品发布。
点评