NeFut Logo NeFut
EN 管理员登录

[AI学术] RobustMAD:评估多模态小型语言模型在异常检测中的现实鲁棒性

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #Open Source

摘要

多模态工业异常检测助手是下一代智能工厂的重要组成部分,能够实现基于视觉-语言的互动查询。然而,由于计算需求高和云端推理带来的隐私风险,多模态大型语言模型在现场部署上依然不切实际。紧凑的多模态小型语言模型(MSLMs)提供了一种可部署的替代方案,但由于缺乏全面的鲁棒性分析和真实工业条件下具有挑战性的基准,进展受到限制。

为了解决这一问题,我们开发了 RobustMAD,这是第一个以部署为动机的基准,旨在通过各种开放式查询全面评估模型鲁棒性,这些查询涵盖了物体理解、异常检测、无法回答的问题以及视觉质量退化。与传统假设相反,表现最好的 MSLMs 展现出令人鼓舞的能力,甚至意外地超过了更大的 GPT-5 Nano。然而,它们仍然未能满足安全关键要求,RobustMAD 揭示了存在的关键鲁棒性缺口,带来了操作风险。

具体而言,出现了三种反复出现的失败模式:(i) 在细致区分或退化视觉条件下的脆弱多模态基础,(ii) 不够全面的响应,以及 (iii) 在无法回答或表述不清的问题上逻辑基础薄弱,导致幻觉输出。基于这些洞见,我们提供了针对下一代多模态工业检测助手设计的可行指导,以利用其有希望的能力。

代码可在 GitHub 上获取。

博主点评: 这项研究展示了多模态小型语言模型在工业应用中的潜力,尽管面临鲁棒性挑战。RobustMAD 基准的提出,为未来的模型改进提供了重要方向,强调了在真实环境中进行全面评估的重要性。

原文链接: https://arxiv.org/abs/2607.16243

[h] 返回首页