摘要
多智能体集成增加了活动参数和推理成本,但未能回答三个基本问题:选择哪些智能体进行咨询、查询应在智能体层次中深入到何种程度以及何时进行智能体间通信是值得的。我们提出了GRADE(Gated Routing and Adaptive Depth for Efficient Reasoning),这是一个分层多智能体系统,其中四个轻量级学习门控共同管理智能体选择、层次深度、智能体间通信和分支剪枝。
训练方法
训练使用CoGRPO(Collaborative Group-Relative Policy Optimization),这是一种新颖的无评论员方法,旨在将GRPO适应于多智能体层次,并为参与回滚的每个门控和智能体分配共享的优势信号。
智能体模型
智能体模型来自于一个可热插拔的专家注册表;每个智能体的校准映射允许在推理时替换专家,而无需重新训练。
性能表现
在大约17B的平均活动参数下,GRADE在GSM8K、MMLUPro和GPQA上超越了所有基线,在MMLUPro上比最强基线高出4.8分,同时活跃计算量仅为其一半。在模型深度占主导的AIME-2025上,GRADE仍然与现有框架竞争。消融实验显示层次结构和掩蔽交叉注意力是准确度的最大贡献者,并表明每个智能体的校准对于安全热插拔是必要的。
博主点评: GRADE系统通过引入门控机制和自适应深度,不仅提升了多智能体推理的效率,也为智能体间的智能协作提供了新的思路。这一创新方法在保持较低计算成本的同时,显著提高了模型性能,展示了未来多智能体系统发展的重要方向。