NeFut Logo NeFut
EN 管理员登录

[AI学术] 多模态大语言模型中间层注意力预测

发布于:2026-08-10 22:00 最后更新:2026-08-11 02:05
#AI #Machine Learning #LLM

近期研究表明,多模态大语言模型(MLLMs)在多个视觉语言任务中表现出色,但由于处理大量视觉令牌的成本,效率受到限制。视觉令牌剪枝可以降低这一成本,但需要准确的令牌重要性估计。现有研究表明,从语言模型中间层的文本到视觉的注意力可以有效地指导视觉令牌剪枝,通常使用预定义的中间层来选择保留的视觉令牌。然而,两个问题仍然存在:首先,我们的分析表明,对于不同样本,响应问题的层次会有很大差异,使得固定层次的方法不理想。其次,获得适当的中间层次的注意力需要处理大量视觉令牌通过多个语言模型层,这时已经花费了大量计算。为了解决这两个问题,我们提出中间层注意力预测(MAP)方法,使用问题对比教师选择来识别样本特定的教师层,并将所选层次的注意力提炼到一个轻量级预测器中,以估计多模态输入特征的视觉令牌重要性。在推理过程中,MAP将预测的重要性得分与多样性标准结合来剪枝视觉令牌,在第一个语言模型层之前。因此,MAP不需要注意力图来进行剪枝,并且与现有的推理加速技术兼容。在十个基准测试中,MAP在LLaVA-NeXT-7B模型上保留了97.5%的未剪枝模型性能,只使用了5.56%的视觉令牌,获得了3.09倍的端到端加速。 博主点评: 本文提出了一种创新性的方法来提高多模态大语言模型的效率,通过预测中间层注意力来指导视觉令牌剪枝。实验结果表明,这种方法可以显著提高模型的推理速度,同时保持较高的性能。

原文链接: https://arxiv.org/abs/2608.06411

[h] 返回首页