设计高性能的自定义 TPU 内核需要深厚的硬件知识。我们利用大语言模型(LLM)和实时编译器反馈,构建了 MaxKernel——一个多代理系统。系统实现了三种开发范式:人机协同(Human-in-the-Loop)代理逐步共同设计;全自动(Auto)代理基于度量和追踪进行闭环优化;基于图的全局搜索将 Auto 代理扩展到设计空间的全局探索。三种范式共享一组专用子代理,负责规划、实现、自我调试、测试以及硬件剖析。我们在 JaxBench(包含 50 项 TPU 核心任务)以及前沿开源模型的真实工作负载上评估 MaxKernel,结果表明其生成的实现始终能匹配专家手工调优的基准,并在多数任务上取得显著加速。代码已开源,地址:https://github.com/AI-Hypercomputer/accelerator-agents/tree/main/MaxKernel。
点评