本文评估了在八种代理编排架构下,将单个LLM代理替换为协作团队对准确率的提升效果。实验使用五种指令微调的7‑9B模型,覆盖五个简答基准和一个可执行代码基准,调用次数上限为30次。结果显示,团队规模的收益高度依赖任务:在两个算术文字题基准(GSM8K、GSMHard)上,调用次数从3增至30时准确率最高提升17分;而在ARC、GPQA、MMLU等选择题基准上提升不超过4分,所有架构均呈现相同趋势,平均值掩盖了这一差异。Proposer‑Critic 架构在算术任务上捕获了最大增益,规模扩展最陡,并在最高预算下整体超越其他架构(区间不含零),但在其他任务上表现最弱,且没有任何架构在所有任务上全胜。为解释这些现象,作者提出了精确的生成‑转换分解:任意工作流可划分为提案覆盖(proposal coverage)和后续转换(downstream transform),准确率变化恰好等于覆盖红利(extensive coverage dividend)加上转换变化(intensive transformation change)。该分解揭示算术任务仍有覆盖余量,批评者引导的转换能够将其转化为准确率提升;而选择题基准要么已在覆盖上饱和,要么转换效果不足;在开放式代码生成任务中,恢复能力几乎消失,准确率随覆盖线性变化。即使在相同调用预算下,代币消耗仍相差2.1倍,说明额外调用提供了候选机会,但仅部分架构在特定任务上能够有效利用。综上,团队规模的扩展是一种任务和架构特定的赌注,而非通用杠杆。
点评