NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性的OmniDelta:基于技能驱动的OmniLLMs令牌压缩预算分配

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

摘要

新兴的全模态大型语言模型(OmniLLMs)能够统一理解文本、音频和视频,但其长音频-视频令牌序列引入了巨大的内存和推理成本。现有的压缩方法主要集中在固定预算下选择重要令牌,而预算分配问题尚未得到充分探讨。我们表明,直接的查询与音频/视频相似性对于跨模态预算分配不可靠,而均匀的模态预算可能会漏掉关键证据,同时保留冗余内容。

为了解决这些限制,我们提出了OmniDelta,这是一种无训练、基于技能的框架,结合了意图感知的跨模态分配与内容感知的内模态分配。OmniDelta首先构建音频和视频技能池,根据查询需求调整固定的保留令牌预算,然后使用局部复杂性和时间冗余重新分配音频段和视频帧的模态预算。最终的局部预算可以与现有的剪枝策略结合,保持总保留令牌比例,同时改变预算的使用方式。

在四个音频-视频基准测试和两个Qwen2.5-Omni模型上的实验表明,OmniDelta在剪枝比例方面建立了新的准确性-效率Pareto前沿。在Qwen2.5-Omni-7B模型中,以25%的令牌保留率,OmniDelta将GPU内存减少了22.0%,并实现了比全令牌推理快1.64倍的端到端速度提升。

博主点评: OmniDelta通过创新的技能驱动框架有效解决了跨模态预算分配的不足,展现出在资源利用和推理速度上的显著提升,为全模态模型的未来发展提供了新的思路。其提出的局部预算分配策略值得进一步研究和应用。

原文链接: https://arxiv.org/abs/2607.25669

[h] 返回首页