NeFut Logo NeFut
EN 管理员登录

[AI学术] ENTRAP-VL:揭示视觉-语言模型中的双重上下文引导现象

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

摘要

上下文引导是指模型在输出时受到输入中辅助上下文的影响,无论该上下文是否相关、真实或有意义。虽然这一现象在单模态语言模型中已有研究,但在视觉-语言模型(VLMs)中的表现尚未得到充分探讨,且缺乏专门的工具来研究此现象。

我们认为,研究VLM中的上下文引导不仅需要将现有文本基准迁移到多模态设置,还需要一个结构化的双模态工具,其条件围绕特定项目(文本流中的图像或视觉流中的文本查询)构建。

我们主张,VLM的转变是实质性的而非渐进的,使得引导现象成为双重现象,能够独立于文本和视觉上下文驱动,并引入了一个真值区分(即在描绘场景中为假但在世界中可能存在的上下文),这一点在以往的单模态知识模型中并不存在。

为了使这一观点具体化并可操作,我们介绍了ENTRAP-VL(视觉和语言的引导评估探针),这是一套手动策划的数据集,包含1500个项目,跨越八个类别,按照两个轴的分类法组织,即上下文与项目的关联及其与真相的关系,并分为文本引导流(八种上下文条件)和视觉引导流(三种上下文条件)。

我们并不声称测量任何特定模型中的引导现象;我们提供了这一工具、激励其的分类法以及所支持的评估协议,以便社区能够对这一现象进行严谨的研究。我们将公开发布该数据集及其文档。

博主点评: ENTRAP-VL为视觉-语言模型提供了一个全新的研究视角,强调了多模态上下文引导的复杂性。这项工作不仅填补了当前研究的空白,还为未来的模型评估奠定了基础,有助于深入理解模型在处理复杂输入时的行为特征。它的发布将极大推动相关领域的研究进展。

原文链接: https://arxiv.org/abs/2607.20092

[h] 返回首页