大型语言模型(LLM)正日益构建多代理工作流,将复杂任务拆解并从代理池中挑选专精子代理。然而,如何确定拆分粒度、分配哪位代理以及何时引入新专精代理仍是构建者必须提前决策的难点。子任务是否成功只有在工作流运行后才能知晓,而改进工作流代价高昂。定位错误通常需要参考答案、评分结果或训练好的评估器,修复则需对整个工作流重新执行、重新搜索或重新训练。我们提出 InFlowOp,它用一种无标签成本对每个决策进行定价,该成本衡量代理能力与子任务需求的匹配程度以及代理的运行耗时。InFlowOp 在执行前通过该成本双向决定任务拆解的粒度和代理分配,而不是依赖固定模板。执行过程中,InFlowOp 仍使用同一成本以最小代价纠正错误。为了解决工作流层面的评估难题,我们构建了 Braid 基准,其任务需要多代理协同,单一代理无法完成。实验覆盖多个领域和模型骨干,InFlowOp 在整体表现上相较单代理基线提升最高 $+11.97\%$,流内优化提升 $+9.64\%$。项目页面:https://xhguo7.github.io/InFlowOp/。
点评