Agentic LLM 工作流由模型回合与工具交互交错组成,整体完成时间受推理速度和回合何时被释放双重影响。传统运行时在回合准备好后立即释放,这种贪婪策略在系统争用时会导致已释放但未完成的工作堆积,工作一旦提交便无法再由工作流层面的调度策略重新排序,进而增加尾部延迟。我们提出一种尾部风险感知的回合释放调度方法,能够同时决定下一个释放的准备好回合以及保留的未完成工作量。该方法以均值‑条件风险价值(mean‑CVaR)目标捕捉未完成工作流的动态尾部风险,利用在线估计的回合工作量对准备好的回合进行优先级排序,并根据观察到的队列压力自适应调整释放工作预算。实验基于真实的代理执行轨迹,涵盖多种 LLM 与不同工作流到达率的软件工程任务。结果显示,在轻负载下该方法与贪婪释放性能相当,而在争用情况下显著降低工作流流时间的 P95,最高可实现 $3.50\times$ 的加速。
点评