NeFut Logo NeFut
EN 管理员登录

[AI学术] BaseRT:利用Apple M5神经加速器提升LLM推理性能的突破

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#optimization #Open Source #Neural

Apple的M5代产品引入了一种重新设计的GPU架构,所有核心均配备专用的神经加速器,这些加速器通过Metal~4张量API暴露的片上矩阵单元。我们展示了BaseRT,这是一种针对Apple Silicon的大型语言模型的原生Metal推理运行时,利用这些单元显著提升了Apple硬件上的推理吞吐量,超越了llama.cpp和MLX。

基于BaseRT的无框架设计,我们增加了一系列手写的Metal~4张量核心内核,包括密集和混合专家GEMM以及闪存注意力预填充内核,这些内核将推理中的计算密集型矩阵乘法路由到M5神经加速器,同时将内存密集型解码路径保留在现有的专用内核上。

在Apple M5 Pro上,针对Qwen3、Qwen3.5/3.6、Llama~3.2和Gemma~4系列,从不足1B到35B参数的十五种模型配置,BaseRT提供了高达$6.4\times$的提示处理吞吐量,相比于llama.cpp高出$3.9\times$,在混合专家模型上,矩阵乘法占主导地位,表现出最大的优势,同时在解码方面保持了领先,最高达到对llama.cpp的$1.75\times$和对MLX的$1.33\times$。这些结果为设备上的LLM推理建立了新的性能上限,表明M5的张量核心是Apple Silicon上提示处理的关键杠杆。BaseRT已在GitHub上公开

博主点评: BaseRT在充分利用Apple M5的硬件优势的同时,展示了高效的推理性能,特别是在处理矩阵乘法时的显著提升,预示着移动设备上大型语言模型推理的未来潜力。其无框架的设计理念也为后续的开发提供了灵活性。

原文链接: https://arxiv.org/abs/2607.19438

[h] 返回首页