科学的进步往往依赖合作,而现有的自主系统很少体现这一点。我们研究了在测试阶段让多个智能体通过共享目录进行通信的效果,重点考察了 ARC-AGI-3 这一需要创新解题能力的基准。实验表明,$k$ 个通信智能体组成的团队(team@$k$)的成功率相当于 $4k$ 个独立智能体的表现,并且随着 $k$ 增大,这一优势呈现叠加效应。更重要的是,某些任务单个智能体根本无法完成,但团队协作却能可靠地解决。
在多边形拼装任务中,通信团队超越了 best@$k$ 的最佳记录,并刷新了已有的最高分。对 MNIST 分类器压缩的实验显示,通信方式产生的 1,957 字节模型在测试集上达到 99.4% 的准确率,既小于人类已知的最佳解,也优于单一智能体的最佳结果。
然而,这些收益并非无条件的。当计算资源受限或缺乏明确的进度衡量时,独立智能体可能表现更好。只有在计算充足且反馈明确的情形下,多智能体通信才能持续带来更强的结果。
点评:测试时的即时信息共享能够在规模化时产生显著的协同增益,尤其适用于需要突破性思路的复杂任务,但仍需考虑资源与反馈的约束。