四指SLAP指纹是用于身份验证的活体扫描印象,涵盖了一只手的食指、中指、无名指和小指。现有研究尚未评估多模态大语言模型(MLLMs)在SLAP图像身份验证中的有效性。为此,我们推出了SLAPBench,这是首个基于MLLM的四指SLAP指纹验证基准,数据来源于NIST SD302b,共包含7,832对指纹(176对匹配,7,656对不匹配)。
我们评估了四个开源MLLM(InternVL3-8B、Qwen2.5-VL-7B、Qwen3-VL-8B、Gemma-3-12B)以及专有模型Claude Opus 4.8,采用零-shot、任务描述和相似性评分提示进行测试。结果显示,提示方式主导了验证行为。任务描述提示导致所有四个开源模型的误接受率(FAR)接近100%,而Gemma-3-12B在零-shot下也出现了崩溃;只有Claude Opus 4.8在这两种二元提示下保持了较好的表现,获得最佳二元结果(FAR = 20.2%)。
相似性评分消除了开源模型的崩溃现象,并揭示了显著的能力差距:Claude的AUC为0.953,Gemma-3-12B为0.837,而InternVL3-8B则为0.590,Qwen2.5-VL-7B接近随机(0.567)。Qwen3-VL-8B达到了完美的分离(AUC = 1.000),但我们将此视为诊断,而非能力体现:SD302b每个手指位置仅有一个SLAP捕获,所以匹配对是跨分辨率的。匹配分辨率控制保持完美分数不变,排除了分辨率捷径;在SD302b中无法排除的则是近重复检测,因为匹配对是同一捕获的两次呈现。对性别、种族和年龄的公平性探测表明,随着歧视减弱,不平等现象加剧。SLAPBench建立了首个SLAP特定的MLLM基准,表明提示方式主导崩溃,而模型能力主导歧视性评估。
博主点评: SLAPBench的推出为多模态大语言模型在实际应用中的有效性提供了重要基准。通过对不同模型的深入评估,研究揭示了模型能力和提示方式在身份验证中的关键作用,未来在实际应用中或将推动更高的准确性与公平性。