我们提出 Mahalanobis‑Ensemble Decoding(ME‑Decoding),将大语言模型的候选 token 选择重新定义为集成剪枝问题。传统方法主要依据标量概率进行筛选,忽视了 token 之间的几何语义关系,导致生成路径冗余。已有的几何感知方案往往需要复杂的优化或直接对原始概率进行再加权,既增加计算开销,又可能引发推理不稳定。为此,ME‑Decoding 将解码表述为一个子集优化问题,目标是基于 Mahalanobis 距离提升语义多样性,同时保留高概率 token。具体做法是构建一个 token 相似度矩阵,利用自适应带宽核函数在 token 嵌入空间上计算相似度,并在此基础上动态折扣冗余生成路径。我们进一步设计了近线性复杂度的贪心选择算法,在候选集规模上实现早停,并给出理论近似保证。该模块即插即用,几乎不增加推理时间。大量在推理与生成任务上的实验表明,ME‑Decoding 能持续提升性能。
点评:ME‑Decoding 通过 Mahalanobis 距离和自适应核构造的相似度矩阵,实现了对候选 token 的几何感知剪枝,在保持高概率的同时显著提升语义多样性,且计算开销低,适合作为通用解码插件。