大型视觉语言模型(VLM)在多模态理解上取得了显著进展,但在教育场景中的实际能力尚未得到系统评估。AI 辅助语言学习要求模型能够解读艺术图像,捕捉其语义、情感与文化内涵,并基于视觉上下文进行推理,以支持有意义的交互。现有基准大多聚焦于真实世界照片或特定学科的推理,未覆盖艺术教育内容。
为填补这一空白,本文提出 MUSE(Multimodal Understanding in Situated Education)基准。MUSE 将图像标注与问题生成解耦,既能控制任务难度,又能降低标注成本。基准包含 12 项任务,覆盖视觉感知、语义解释、情感解读、文化理解以及组合推理等维度。所选艺术图像有意聚焦新加坡及东南亚的多元文化背景,同时兼顾西方艺术传统,提供多主题、多难度的测试集合。
我们对多款开源模型和商业闭源模型进行了评估,结果显示在情感解读和组合推理等能力上存在显著差距。进一步的错误分析揭示了模型普遍的失误模式,如对文化符号的误判、情感强度估计不足以及跨模态推理链条断裂等。这些发现指明了构建可信教育多模态模型的关键挑战。
点评:MUSE 为教育情境下的视觉语言理解提供了系统、可扩展的评估平台,帮助研究者定位模型薄弱环节并推动技术向更可靠的方向发展。