NeFut Logo NeFut
EN 管理员登录

[AI学术] CERA-MoA:共进化路由机制与持续学习的 LLM 代理

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

当前的混合代理(Mixture‑of‑Agents,MoA)框架通常把查询路由和代理微调视为独立步骤,这导致路由策略难以跟随代理能力的演化,代理也难以在数据驱动的协同专化中获益。为了解决这一瓶颈,本文提出 CERA‑MoA(Co‑Evolving Router with continually learning Agents for Mixture‑of‑Agents),它是一种迭代式强化学习框架,动态路由器与各自的代理策略同步进化。

我们设计了预测熟悉度估计器,利用代理中层隐藏状态来衡量语义能力,从而避免完整回滚的计算开销。基于这些熟悉度分数,累计阈值自适应路由机制会动态激活一个量身定制的最小代理子集,实现任务性能与计算效率的平衡。

在训练阶段,系统会主动将针对性的样本分配给当前能力最匹配的代理,促使不同代理在能力上形成差异化。

在多个领域的广泛实验表明,CERA‑MoA 在任务成功率和资源利用率上均显著超越了最先进的静态路由和固定工作流微调基线。

点评:CERA‑MoA 通过路由器与代理的协同进化,实现了路由策略的自适应和代理能力的持续分化,为大模型混合系统提供了新的设计范式。

原文链接: https://arxiv.org/abs/2609.18779

[h] 返回首页