摘要
近年来,视觉语言模型(VLMs)的进展加速了其在室内安全隐患评估中的应用。然而,现有基准存在三大根本局限:
- 过度依赖通过仿真软件构建的合成数据集,导致与真实环境存在显著的领域差距;
- 安全任务过于简化,对隐患和场景类型施加了人为约束,限制了模型的泛化能力;
- 缺乏严格的评估协议,无法全面评估模型在复杂家庭安全场景中的能力。
为了解决这些挑战,我们引入了TSHA(可信的安全隐患评估),这是一个综合基准,包括66,668对经过验证的问答对,其中64,961对经过精心策划的训练问答对来自现有的室内数据集、互联网帧/图像、AIGC图像、新捕获的图像和Hunyuan全景图像。该基准还包括一个具有挑战性的测试集,包含1,707对问答对,不仅包括从训练分布中精心选择的子集,还包括新增的Sora生成视频和包含多个安全隐患的Hunyuan全景图像,用于评估模型在复杂安全场景中的鲁棒性。
在22个流行的VLM上进行的广泛实验表明,当前的VLM在安全隐患评估方面缺乏强大的能力。值得注意的是,基于TSHA训练集训练的模型在TSHA测试集上实现了高达+18.3分的显著性能提升,并且在其他基准上也表现出更好的泛化能力,突显了TSHA基准的重要贡献和意义。
博主点评: TSHA基准的引入将极大推动视觉语言模型在安全隐患评估领域的应用,尤其是在真实世界场景中。通过解决现有基准的局限性,TSHA为模型的开发与评估提供了更为严谨的基础,期待更多研究者基于此进行深入探索。