NeFut Logo NeFut
EN 管理员登录

[AI学术] 学习跳过:用于高效多代理 LLM 工作流的反事实信用分配

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#optimization #LLM #Artificial Intelligence

多代理 LLM 工作流通常包括规划、执行、验证和摘要等环节,以提升任务表现。但每个环节的价值取决于已有的状态,盲目执行所有环节会浪费计算或覆盖正确的中间答案。我们将“跳过某环节”视为反事实信用分配问题:完整工作流日志提供实际轨迹的奖励,受控的跳过干预揭示省略后续步骤的后果。基于此提出 Learning What to Skip (LW2S),它从干预数据中学习针对每个动作的安全模型,并结合留出校准和领域特有的守护条件决定是否跳过。当早期跳过被拒绝时,控制器仍可继续执行并在后续环节重新评估。实验在数学推理、多项选择问答和代码生成三个任务上,使用两类指令模型,显示 LW2S 在降低记录的 token 消耗的同时,保持或提升整体准确率。进一步的规模扩展和第二拓扑实验分析了组件冗余,错误共享案例说明仅凭一致性不足以决定跳过。研究表明,高效执行工作流等价于学习各组件的条件效用。

点评:LW2S 通过反事实干预实现了对工作流组件价值的动态评估,在保持性能的前提下显著节约计算资源,为多代理 LLM 系统的实际部署提供了可行路径。

原文链接: https://arxiv.org/abs/2609.30734

[h] 返回首页