NeFut Logo NeFut
EN 管理员登录

[AI学术] FlashDrive:闪电般的视觉语言动作推理技术,助力自动驾驶实现实时控制

发布于:2026-08-14 22:00 最后更新:2026-08-16 07:03
#AI #optimization #Autonomous Driving

近日,研究人员提出了一种名为 FlashDrive 的算法-系统协同设计框架,旨在解决自动驾驶中视觉语言动作(VLA)推理的高计算成本问题。VLA 模型虽然能够实现端到端推理,但其计算成本仍然太高,难以实现实时控制。FlashDrive 框架通过针对 VLA 推理的四个瓶颈阶段(视觉编码、语言模型预填、推理令牌生成和流匹配去噪)进行优化,采用了多种轻量级算法捷径,例如时序重叠、非自回归扩散和自适应步长缓存等。同时,FlashDrive 框架还结合了系统级别的 CUDA Graph 编译和内核融合技术,进一步提高了性能。在 Alpamayo 1.5-10B 模型上,FlashDrive 框架将端到端延迟从 717ms 减少到 151ms(4.7 倍),同时保持了基本不变的准确性。这种技术突破使得 10 亿参数的 VLA 推理模型可以在单个 GPU 上从 1.4Hz 提升到 6.6Hz,显著推进了自动驾驶的实时部署。 博主点评: FlashDrive 框架为自动驾驶领域带来了新的希望,通过算法和系统的协同优化,实现了实时控制的关键一步,未来自动驾驶的发展将更加迅速和安全。

原文链接: https://arxiv.org/abs/2608.12932

[h] 返回首页