语言模型已经能够生成比 PyTorch 更快的 GPU 核心。我们在 KernelBench Level 1 上评估了五种模型配置,发现最先进的模型能够为 91.1% 的问题生成正确的核函数,并在 56 个问题中有 22 个实现了加速,三种卷积算子也被加速,速度提升的中位数为 1.235×。相比之下,开源权重模型表现差距明显,最佳模型仅有 30.4% 的正确率,只有三例加速且未能加速任何卷积。
随后我们探讨了一个文献未涉及的问题:这些核函数在真实模型运行时间中占比多少?我们对三个领域的七个工作负载进行剖析,发现可利用的时间比例在 8.9% 到 58.2% 之间。对于 Transformer,80%‑86% 的运行时间消耗在 cuBLAS GEMM 与 FlashAttention 上,这将端到端的潜在提升上限定在约 1%,且随着模型规模增大,这一比例进一步下降。推荐系统的工作负载中,可利用比例为 58.2%,主要集中在单个嵌入核函数上。
为此我们推出 DLRM‑Bench,提供 12 个推荐系统核函数问题,采用 KernelBench 的格式。实验显示,前沿模型在这些问题上有 41.7% 的胜率,中位加速比为 1.552×,对应的端到端提升约为 8.63%。
另外,我们发现 KernelBench 的正确性检查(使用 torch.allclose 并设定绝对容差)在 60 个 Level‑1 问题中有 4 个可以被全零张量通过。我们的实验中有两个核函数利用了这一漏洞,其中一个在评分上达到了 283×,但实际只写入了 0.3% 的输出缓冲区。为避免此类误判,我们提出了尺度不变的替代检查,并公开了全部 879 次评估结果。
点评