我们构建了 CulturalMenuBench,收录 4,870 条菜品数据,覆盖 10 种语言、18 个地区。每条记录提供成品图、步骤图、配料表、烹饪文字说明以及地区标签,形成 10 项任务,从基本识别到基于过程的文化归属均有覆盖。\ \ 在 12 种多模态语言模型上进行评估,发现一个显著的知识‑应用鸿沟:在标准四选一题目上模型可达 94% 以上的准确率,但在将菜品归属到中国地区菜系时最高仅为 56%。\ \ 诊断分析显示错误模式接近随机猜测,准确率随视觉差异而非文化结构波动;仅凭菜名就能比图像多提升 7‑18 分,说明模型内部已有文化知识,却难以通过视觉输入激活。\ \ 消融实验进一步验证,去除顺序烹饪图会显著削弱过程相关任务的表现,而其他任务基本不受影响,表明这些任务确实需要过程证据。\ \ 总体来看,CulturalMenuBench 揭示了近乎完美的识别能力可能掩盖了对文化知识的应用不足,呼吁在训练中显式关联感知、过程与文化语境。\ \ 点评