NeFut Logo NeFut
EN 管理员登录

[AI学术] LLM生成的GPU内核是否能投入生产?基于追踪的基准与优化代理

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #optimization #C++

摘要

现有的GPU内核生成基准往往来自于合成或策划来源,未能反映实际部署的工作负载。我们提出了Atrex-Bench,这是一个基准测试,包含30个操作符和440种形状,直接从计算限制、内存丰富的GPU的全集群生产推理追踪中采样。

每个问题都携带一个重要性权重,该权重源于其观察到的GPU时间份额,按应用卡时数加权,并分别计算于其运行的服务阶段,同时附带每个问题的屋顶线上限,以强调消耗最多服务时间的内核。

在Atrex-Bench上评估六个前沿编码代理显示,即使是最好的普通模型在生产操作符上也只能达到约10%的硬件屋顶线;而单靠正确性过于高估了能力,因为显著的通过率大部分来自于PyTorch的回退,而非模型生成的内核。

为缩小这一差距,我们共同发布了Atrex-Kernel-Agent (AKA),这是一个基于性能的内核优化代理,结合了迭代测量-修正搜索、通过优化掉出逃离停滞搜索上下文的策略,以及一个分层的GPU优化知识库(包含298个参考内核文件和244个优化知识文档,以及用于API/ISA查找的外部上游参考项目)。在一个受控案例研究中,该代理将零FlyDSL回退转换为实际内核,这些内核的性能与手动调优的生产基准相匹配或超越。

博主点评: 本文提出的Atrex-Bench与Atrex-Kernel-Agent为GPU内核生成提供了重要的实证依据,显著提升了生成内核的生产适用性,尤其在真实负载下的表现解析方面。未来,随着更多优化技术的引入,LLM生成内核的能力将持续提高。

原文链接: https://arxiv.org/abs/2607.14541

[h] 返回首页