EvoSteer 提出了一种在线自进化图编排范式。传统的多智能体编排在轨迹结束后才进行后置演化,导致信用分配不精准,且技能加入缺乏校准。EvoSteer 在执行过程中实时构建团队,并利用执行特征和学习到的价值估计修复可能失败的步骤。
核心技术包括:
- Anchored Trajectory Balance (AnchorTB):一种回归式流匹配损失。它通过将子轨迹与冻结的参考轨迹平衡,为每个编排动作分配系数。形式化为 $$L_{\text{AnchorTB}} = \sum_{(s,a)} \left( f_{\theta}(s,a) - \hat{f}_{\text{ref}}(s,a) \right)^2$@@@MATH_BLOCK1@@@f{\theta}@@@MATH_BLOCK2@@@\hat{f}{\text{ref}}$ 为参考流。
- Validated Skill Admission:在技能晋升前先进行试用,只有在共享的名义测试预算下,配对证据通过顺序检验才被正式加入。该过程保证了技能的有效性并防止无效技能长期占用资源。
AnchorTB 还结合了任务层面的参考奖励统计以及前缀依赖的校正,使得信用分配既考虑全局奖励分布,又能对局部决策进行细粒度调整。
实验在 12 个数据集上覆盖问答、数学推理、代码生成和交互决策四大场景。结果显示,EvoSteer 在所有基准上均显著超越现有方法,尤其在复杂推理任务上提升超过 15%。
代码已开源:https://github.com/beita6969/evosteer
点评:EvoSteer 通过实时修复和严格的技能验证,实现了更可靠的多智能体协同,值得在实际系统中进一步探索。