NeFut Logo NeFut
EN 管理员登录

[AI学术] InSituMeasure:在工业场景中使用多模态大语言模型进行情境测量评估

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#Machine Learning #LLM #Artificial Intelligence

在熟练操作员眼中,读取仪表读数几乎不需要专业知识,认知负荷低且可重复性高。然而,多模态大语言模型(MLLM)在连续数值测量任务上仍表现不稳,尽管它们在通用多模态基准上取得了显著成绩。现有评测往往将测量任务与真实的知识背景、专业仪器、现场噪声以及对应的诊断标注割裂,导致场景缺乏真实感,且难以进行根因分析。

我们推出 InSituMeasure 数据集,用于评估模型在情境化测量中的 grounding 能力。数据集收录 2,922 张真实工业监控画面,覆盖八类专业工程仪表,每张图像配有密集的仪表属性标注和噪声标签,便于故障诊断。我们设计了三类评测指标:

  1. 在预设容差范围内的数值准确度以及单位一致性;
  2. 对于伪任务或不可回答任务的拒答能力;
  3. 模型错误与标注噪声因素之间的一致性。

在 24 种最新的 MLLM 中,最高的联合数值‑单位准确率仅为 25.7%,置信度‑诊断 F1 为 51.8%,揭示出通用多模态能力与可靠情境测量之间仍有巨大差距。进一步分析表明,模型错误主要来源于文本诱导的捷径、过度自信的回答以及真实工业噪声(包括混合干扰、视角偏移、遮挡和环境干扰)。

点评

原文链接: https://arxiv.org/abs/2609.04014

[h] 返回首页