NeFut Logo NeFut
EN 管理员登录

[AI学术] 多代理扩展在析取与补偿任务中的表现

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

多代理大语言模型系统常被期待随团队规模增大而提升性能,但实际的扩展行为取决于任务结构。本文引入 Steiner 的任务分类法,将团队任务划分为析取任务和补偿任务,以此作为分析多代理扩展的框架。我们将独立抽样的代理建模为在给定条目条件下相互独立,从而得到大团队的极限行为:多数投票收敛到模型的众数答案,平均则收敛到模型在该条目上的偏置。

在选取的若干基准、13 种开源权重模型以及最多 30 代理的实验中,观察到截然不同的扩展特征。对析取任务而言,至少有一名代理正确的概率随团队规模提升 5~20 个百分点,但直接对答案进行多数投票几乎没有实现这部分潜力,模型平均仅提升 0.5 个百分点。多轮修订能够显著提升准确率,然而一次同伴修订与 29 次同伴修订的增益几乎相同。

相反,在费米估计这类天然适合聚合的补偿任务上,扩展收益有限。模型样本之间共享的条目级偏置约占误差平方的 87%,因此平均只能将误差降低约 6%。不同模型族的组合在费米估计上有一定提升,但仍未超越单一最强模型在析取任务上的表现。

这些结果表明,任务结构以及成员输出的组合机制是决定团队扩展效果的根本因素。

点评

原文链接: https://arxiv.org/abs/2609.31563

[h] 返回首页