NeFut Logo NeFut
EN 管理员登录

[AI学术] FineServe:全球 LLM 服务工作负载的细粒度数据集与特征分析

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#algorithm #optimization #Open Source

摘要

大型语言模型(LLMs)越来越多地作为常驻在线服务进行部署,使得高效的 LLM 服务成为一个关键的系统挑战。为了在波动的需求下实现低延迟和高吞吐量,需要对现实世界的服务工作负载有深入的理解。然而,现有研究通常依赖于代理跟踪或粗粒度的特征化,无法捕捉现代多模型 LLM 平台的异构性。

我们提出了 FineServe,这是一个在真实环境中收集的多模型 LLM 服务工作负载数据集,来源于全球商业市场,使得对现实世界服务动态的细粒度特征化成为可能。借助 FineServe,我们对到达动态和令牌行为进行了全面分析,揭示了不同模型架构、规模和任务意图之间存在根本性的波动机制。

基于这些洞察,我们开发了 FineServe 工作负载生成器,能够将细粒度的模型感知工作负载组合成可配置的混合,以便于基准测试多模型服务平台。通过揭示这些细粒度的工作负载动态,FineServe 为评估 LLM 服务系统中的路由、调度和容量规划策略提供了现实的基础。FineServe 数据集可在 GitHub 上获取。

博主点评: FineServe 数据集的推出为 LLM 服务的性能优化提供了宝贵的实证依据,尤其是在多模型环境中。通过细粒度的特征分析,研究者可以更好地理解动态负载,从而制定更高效的调度算法,提升服务质量。此项研究将推动 LLM 服务系统的进一步发展。

原文链接: https://arxiv.org/abs/2607.19349

[h] 返回首页