NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越最终准确率:审计LLM多代理系统中的通信

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

多代理通信旨在让代理相互利用信息提升表现。然而系统性能的提升往往掺杂了有效通信、优越的代理结构或单纯的额外推理三者的贡献。由于通信方法通常在其设计的系统内部评估,这些因素难以分离。最终准确率把纠正错误和产生错误的答案混为一体,掩盖了通信对决策的具体影响。我们提出独立‑通信‑修正(ICR)框架,将通信视为在独立推理后对答案的修正。ICR 固定初始推理轨迹,依据两代理的初始正确性分别衡量纠正率和保持率,并引入无信息修正对照以量化超出额外推理的收益。我们在四个推理基准上审计文本和潜在通信,发现相似的整体准确率可能隐藏截然不同的修正行为。与仅传递答案相比,完整推理在所有基准上提升纠正率但降低保持率,说明更丰富的消息会放大有益和有害的影响。对 MedQA 和 GPQA‑D 的接收者策略比较表明,结构化验证策略使所有通道的保持率提升、纠正率下降,其对选择性的影响在不同通道和任务间存在差异。这些结果挑战了将通信质量视为通道固有属性的做法。ICR 因此将评估重心转向选择性修正,提供统一框架以考察消息内容与接收者策略如何共同产生收益与危害。

点评

原文链接: https://arxiv.org/abs/2610.01042

[h] 返回首页