随着大型语言模型处理更多请求,累积推理成本变得越来越重要。推理阶段有两个阶段:提示预填充是并行和计算密集的,而自回归解码是顺序和内存带宽密集的。传统的宽度或深度缩放增加了两种成本,因为每个添加的层都在两个阶段中进行评估。我们引入了双向转换器(Dual-Flow Transformer),它的主要流程是处理提示和写入键值缓存,而辅助流程仅在提示处理完成后激活,添加续写预测计算而不影响主要流程。两个流程共享主要注意力、MLP和输出矩阵,同时使用单独的令牌嵌入和轻量级耦合。共享权重和主要缓存也为重用加载的权重和缓存的键和值在分组执行中提供了机会。在匹配令牌比较中,双向转换器在验证损失上取得了更好的结果。我们研究了两个场景:在固定预填充专家计算的情况下增加解码计算,以及在两个流程之间重新分配固定解码专家预算。这些实验揭示了预填充-解码-质量权衡,并证明了阶段特定专家分配的潜力。 博主点评: 双向转换器解耦了主预填充路径和额外解码计算,实现了更好的推理效率和更低的验证损失。这一技术有望在大型语言模型中得到广泛应用,提高模型的性能和效率。