大型语言模型(LLM)代理通过提议‑测量‑保留的闭环来调优 GPU 内核和服务引擎,但该闭环背后的测量往往不可靠。我们从四天、619 次模型调用的试点语料中归纳出四种失效模式:草率基线制造虚假加速、绝对时间在不同机器间不可迁移、任务饱和导致比较失效、基础设施缺陷冒充科学成果。\ \ 为了解决这些问题,AutoTuneBench 提出了一套基准和测量协议,使信任成为架构属性。协议以代码冻结并通过测试强制来源;数据库层验证器拒绝协议外的结果;防作弊检查在代理的修改面之外运行;比较遵循预注册的读数;测量锚定到外部已发布结果,并使用配对随机种子统计,跨运行变异系数上限为 $5\%$。\ \ 在此框架下的测量结果大幅修正了原始 headline:最佳内核相对于天真的基线提升 $10.6\times$,相对于诚实基线提升 $2.03\times$;一种配置在机器 A 上提升 $1.174\times$,在机器 B 上提升 $1.0049\times$;预注册的开/关比较在共享壁面上几乎持平,分别为 $2.4840\,$ms 与 $2.4957\,$ms;KernelBench Level‑1 套件接受了 $51\%$ 的任务,整体中位加速仅为 $1.0001\times$,相较于 PyTorch eager。\ \ 协议本身、两大引擎(vLLM 与 SGLang)的语料以及完整审计链均作为开源制品发布。\ \ 点评:AutoTuneBench 通过严密的协议和可验证的基准,消除了自动调优过程中的测量欺骗,为 LLM 服务的性能评估提供了可靠的基石,也为后续研究设定了可复现的标准。