NeFut Logo NeFut
EN 管理员登录

[AI学术] FlashVector:用于分层模型服务栈优化的智能体

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #optimization

模型服务是生产推荐系统中最大的成本来源之一。要提升吞吐量,需要在 GPU 内核、机器学习框架计算图、模型服务器以及按需特征处理等多层次结构之间进行细致调优,每一层都需要专门的领域知识。跨层次的专业技能难以获取,且难以随业务规模和模型演进而扩展,导致大量潜在的成本效益未被实现。

近期的 AI 智能体已经在单一 GPU 内核优化上达到了接近人类专家的效率,但对整个服务栈的自动调优仍鲜有探索。为此我们提出 FlashVector——一个能够在模型服务栈所有层面进行性能优化的智能体系统。核心贡献是一个可扩展框架,能够把单内核优化智能体的思路推广到异构技术栈,实现整体性能提升。

在 Unity 的 Vector 广告平台部署后,FlashVector 在模型服务器上实现了最高 2 倍的吞吐量提升和 1.98 倍的延迟加速,在特征存储上提升了 1.6 倍的吞吐量。这些优化不仅来源于 GPU 内核和计算图层面的改进,还覆盖了模型服务器(基于 NVIDIA Triton 的 C++ 代码)以及按需特征转换服务(Python 代码),验证了框架在更复杂系统架构中的可扩展性。

点评:FlashVector 展示了跨层次自动化调优的可行路径,为大规模推荐系统的成本控制提供了新的思路。

原文链接: https://arxiv.org/abs/2609.17391

[h] 返回首页