AI 系统在全球范围内得到广泛应用,但在满足文化多样性需求方面仍显不足。已有研究多聚焦于纯文本理解或对单一视觉物件(如食物、服饰)的识别,缺乏对可观察行为背后社会规范的推理能力。为填补这一空白,我们构建了 NormViz-Bench——一个经人工验证的高质量基准,包含 3,268 对对比图像(共 6,536 张),覆盖 16 个国家。每对图像仅在文化相关的行为要素上有所差异,包括对象、属性、空间关系和动作等。图像被标注为符合、违背或与当地社会规范无关,评估要求对每对图像的两张都做出正确分类,从而避免模型依赖表层视觉线索。实验表明,即使是最强大的视觉语言模型 Gemini 3.0 Flash 与 Qwen2.5 VL 7B,也仅在 26.6% 与 21.6% 的图像对上取得正确判断,尤其在识别违背规范和文化中性行为时表现最差。为提升模型的文化感知能力,我们进一步推出 NormViz-Train——一个包含 64,000 张图像及其解释的训练集。尽管加入该数据后模型性能仍然有限,但已显现出对视觉规范理解的潜在提升空间。
点评