NeFut Logo NeFut
EN 管理员登录

[AI学术] 蒸馏视觉语言模型用于设备端火灾理解

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #Neural

视觉语言模型(VLM)通过对场景语义进行推理,能够在降低误报的同时提升火灾检测的可靠性,但其庞大的参数量限制了在嵌入式传感器上的部署。本文聚焦于将针对火灾理解微调后的领域专用 VLM 进行压缩,以实现完全在设备端运行且不牺牲安全关键行为。我们提出了教师‑学生知识蒸馏框架:先使用大模型(教师)在火灾数据上进行微调,然后通过对齐 logits 与中间特征的方式,将知识迁移到轻量学生模型。实验覆盖多个 VLM 系列(如 Qwen、LLaVA 等)和不同规模,结果表明压缩后的学生在火灾语义理解上保留了大多数教师能力。进一步,我们将蒸馏得到的模型部署到商用 Detectium 火灾传感器,联合评估推理准确率、延迟和内存占用。发现压缩不仅影响整体精度,还会改变模型的失效模式,其中 Qwen2.5-0.5B 在精度、速度和资源占用之间取得了最佳平衡。本文的经验为在资源受限且安全关键的场景中部署领域专用 VLM 提供了参考。

点评

原文链接: https://arxiv.org/abs/2609.05782

[h] 返回首页