摘要
大型语言模型(LLMs)的普及使得服务系统从处理孤立请求转向协调高并发的多租户智能工作流。然而,现有解决方案通常优先考虑工作流内部的优化,忽视了工作流之间优化的巨大潜力。本文提出了HeraSys,一个旨在优化并发工作流端到端性能的LLM服务系统。
通过细粒度的调度,HeraSys通过结构节点合并和重用消除了跨工作流的计算冗余。此外,HeraSys引入了一种负载感知的联合调度策略,动态管理执行顺序,同时评估交互和内部查询的优先级。
通过将资源偏移机制与自适应批处理和管道分解相结合,HeraSys有效降低了尾延迟,同时保持较低的平均延迟,从而显著提高了系统吞吐量。
大量实验表明,HeraSys在严格的延迟保证下可将P99延迟减少最多2.17倍,服务吞吐量提高最多1.85倍。
博主点评: HeraSys通过优化多工作流之间的资源利用,展示了在LLM服务系统中实现高效调度的新思路。其负载感知策略和结构节点重用机制有效解决了并发处理中的延迟问题,值得关注。