在 LLM 推理中,采样涉及一系列组合的 logit 处理、标记选择和用于推测解码的验证操作。然而,现有实现仅加速此流程的某些子集,依赖多个内核启动,或假设批次内的采样行为是均匀的,这限制了对动态服务工作负载的支持,并妨碍了高效的 CUDA 图执行。
我们提出了 SonicSampler,一个统一的 tile 感知 Triton 内核套件,它将完整的采样管道垂直融合到一个固定的、工作负载感知的执行模型中。
我们的内核支持动态的每请求采样行为,包括语法约束解码、重复、频率和存在惩罚、logit 偏差、温度缩放、top-$k$ / top-$p$ / min-$p$ 过滤和推测验证——在一个单一的批处理内核中,同时保持完全的 CUDA 图兼容性。
我们方法的核心是一种新颖的分层两阶段 top-$k$ 算法,与竞争基线相比,速度提升高达 10倍,并利用 LLM 输出的低熵结构,从而在大词汇表上实现高效选择。
在异构推测解码工作负载中,SonicSampler 以高达 16倍 的速度超越最先进的基线,同时保持灵活的批处理执行。