NeFut Logo NeFut
EN 管理员登录

[AI学术] 一次性提升性能与降低成本:字节精确的KV缓存嫁接技术

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

我们报告了一种方法,使得一个冻结的小型语言模型在不改变任何权重的情况下,既能提升能力又能显著降低成本。经过验证的知识作为字节精确的键值(KV)状态工件被一次性存储,随后通过嫁接的方式恢复到新的推理上下文中。

恢复过程是逐位精确的:在固定的确定性配置下,嫁接后的logits与新的计算结果逐字节相同(SHA-256相等),KL散度为零,且在五十个样本上实现了100%的argmax一致性。

我们展示了自身位置嫁接是浮点旋转编码模型的唯一数值精确操作点,并在两个模型规模(12B和31B)及两个GPU目标上验证了字节精确性,其中一个通过预注册重放完成。

在AIME 2025上,冻结的Gemma-4-12B模型在嫁接了一个经过验证的解决方案库后,从80.0%提升到93.3%,超过其自身77.5%和31B兄弟模型89.2%的已发布基准。

在重复案例中,基础模型在401,026个token预算内未能解决的八个问题,借助缓存的验证解决方案仅用61个解码token解决,减少了6,574倍的token数量和约8,700倍的能耗;能力声称基于持有的转移(31B模型中7个中的7个)。

相同的字节精确存储将可用上下文从32,768扩展到2,854,766个token,且不需要额外的加速器内存,并且在相同架构的机器之间保持字节一致。

我们在行为层面描述了该系统;引擎是专有的,所有报告的数据均由承诺的输入和输出哈希支持,因此可以在不使用引擎的情况下重新检查评分。

博主点评: 这种字节精确的KV缓存嫁接技术在不改变模型权重的前提下,显著提升了模型性能并降低了能耗,展现了高效利用已验证知识的潜力,值得在实际应用中进一步探索。

原文链接: https://arxiv.org/abs/2607.14431

[h] 返回首页