多代理大语言模型系统会把任务拆分到不同模型上,回答往往需要另一个代理的上下文信息:Sharer 编码的信息是 Receiver 完成任务所必需的。传统做法是通过文本交换,这会把自回归解码放在关键路径上,且信息只能在发送时看不到接收方状态。最近的潜在协议把 Sharer 的键值缓存直接映射到 Receiver:C2C 支持异构模型但要求两者读取相同输入,LCF‑X 通过无位置的 Sharer‑cache 池化消除了共享上下文的需求。LCF‑X 仍有三大限制:仅压缩 Sharer,向每个 Receiver 位置提供相同的层局部摘要,且假设层数和 KV 结构匹配。我们提出 XKV,全面解除这些限制。XKV 使用学习查询注意力同时池化两端缓存;在对齐的层 token 上做自注意力,并通过学习的层映射处理不同深度,将池化摘要混合成紧凑的联合记忆;共享位置解码器使每个原始 Receiver 缓存位置能够在其本地 KV 几何中检索到按头门控的残差。所有模型保持冻结,可在模型族、深度、KV 头数、头维度和分词器上不一致,仅训练翻译器。实验在 45 种数据集‑模型配对(六种异构、三种同模型有序配对,五个数据集)上,XKV 获得最高宏观得分和最佳平均排名,在每个数据集上均优于 LCF‑X(在 ROPES 上提升 4.6 点 Exact‑Match、4.2 点 F1),并在五个数据集中的四个上超越文本通信。XKV 训练参数比 LCF‑X 少 76%,缓存对翻译速度提升 10.3 倍(5.8 ms vs 59.9 ms),端到端比 LCF‑X 快 26%,比文本通信快 6.8 倍。
博主点评:XKV 的设计巧妙地解决了异构模型间的缓存对齐难题,显著提升了跨模型协作的效率,是潜在空间通信的重要里程碑。