NeFut Logo NeFut
EN 管理员登录

[AI学术] VideoMM:自适应宏微推理实现高效视频大模型

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

VideoMM是一种自适应宏微推理框架,针对长视频理解中的视觉令牌爆炸问题。它将视频帧先下采样生成宏观代理(Macro Proxy),在该低成本表示上进行语义过滤,选出与任务相关的区域。随后,仅对这些区域投射到高分辨率的微观令牌(Micro Tokens)进行细粒度推理。这样实现了选择与推理的解耦,既保留关键语义,又显著降低计算开销。实验在LongVideoBench上显示,VideoMM比全上下文基线快6.13倍,准确率提升7.4%,并比当前最优方法再提升2.73倍。代码已开源。

点评:VideoMM通过在粗粒度上筛选语义,再在细粒度上精细推理,提供了兼顾效率与精度的可扩展方案,为长视频理解设立了新基准。

原文链接: https://arxiv.org/abs/2609.16722

[h] 返回首页