NeFut Logo NeFut
EN 管理员登录

[AI学术] MUSE:面向情境教育的多模态视觉语言模型基准

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #Open Source

大型视觉语言模型(VLM)在多模态理解上取得了显著进展,但在教育场景中的实际能力尚未得到系统评估。AI 辅助语言学习要求模型能够解读艺术图像,捕捉其语义、情感与文化内涵,并基于视觉上下文进行推理,以支持有意义的交互。现有基准大多聚焦于真实世界照片或特定学科的推理,未覆盖艺术教育内容。

为填补这一空白,本文提出 MUSE(Multimodal Understanding in Situated Education)基准。MUSE 将图像标注与问题生成解耦,既能控制任务难度,又能降低标注成本。基准包含 12 项任务,覆盖视觉感知、语义解释、情感解读、文化理解以及组合推理等维度。所选艺术图像有意聚焦新加坡及东南亚的多元文化背景,同时兼顾西方艺术传统,提供多主题、多难度的测试集合。

我们对多款开源模型和商业闭源模型进行了评估,结果显示在情感解读和组合推理等能力上存在显著差距。进一步的错误分析揭示了模型普遍的失误模式,如对文化符号的误判、情感强度估计不足以及跨模态推理链条断裂等。这些发现指明了构建可信教育多模态模型的关键挑战。

点评:MUSE 为教育情境下的视觉语言理解提供了系统、可扩展的评估平台,帮助研究者定位模型薄弱环节并推动技术向更可靠的方向发展。

原文链接: https://arxiv.org/abs/2609.19088

[h] 返回首页