代理式 AI 系统在完成同一任务时常会采用多种工作流,这些工作流在推理策略、验证结构和计算成本上各不相同。直接选取平均性能最高的工作流进行部署看似自然,却可能次优,因为不同工作流往往在不同实例上表现出色。为此,本文提出 组合‑选择器范式:企业同时运行若干工作流实例,并在观察到它们的输出后再决定最终答案。额外的执行可以捕获单一最佳工作流遗漏的正确答案,但也会消耗计算资源,并产生可能误导选择器的干扰答案。
我们将此问题形式化为 工作流组合问题,企业需要同时决定运行规模以及在各类工作流之间的资源分配。为衡量选择器质量,引入 赔率提升指数(odds‑lift index),记为 $OL = \frac{P(\text{正确}\mid\text{选择器})}{P(\text{正确})}$,该指标反映选择器相对于随机选择的提升程度。基于此,我们推导出工作流多样性的严格上、下界。
针对有限工作流集合,本文给出精确的整数规划模型、线性规划松弛以及随机舍入算法,并提供可计算的性能证书。对于规模庞大的隐式工作流类,构造了有限维对偶问题,并利用 椭圆法 配合 定价 oracle 来识别在加权准确率(扣除重复计算成本)上表现突出的工作流。在弱条件下,该方法仅需多项式次数的 oracle 调用,即可获得松弛问题的近似最优解。
实验在三个数据集上验证了框架的有效性:ABCD、Schema‑Guided Dialogue 和 HotpotQA。相较于单一最佳工作流,组合优化分别提升了持出选择器准确率 3.1、7.5 和 0.9 个百分点。进一步使用对偶引导的工作流生成,在 ABCD 上额外提升 3.5 点,在 HotpotQA 上提升 24.1 点,而在 Schema‑Guided Dialogue 上未见额外增益。
点评:本文系统地刻画了在计算受限且选择不完美的情境下,多工作流组合的价值,并提供了从理论界限到可实现算法的完整工具链。实验结果表明,即使在已有强大单工作流的基准上,适当的组合仍能带来显著的性能提升,为实际部署提供了可操作的指导。