相机陷阱常在现场的边缘硬件上运行,网络连接有限或不存在,这使得体积小、可本地部署的视觉语言模型(VLM)成为实际评估的重点,而非前沿的大规模模型。我们在 2–8 B 参数范围内挑选了四种 VLM(Qwen3‑VL 2B、4B、8B,Gemma3 4B),并与专门针对生物领域训练的 BioCLIP(300 M 参数)进行比较。实验使用 96 种动物的任务,分别在 iNaturalist 的干净照片和来自 LILA.science 的 6 个相机陷阱数据集上进行评估,构建了两套独立抽样的测试集。所有模型的识别准确率均远高于随机水平,但在现场图像上表现显著下降,下降幅度在 9.6–26.6 个百分点之间,且在不同分类层级和两套评估集上保持一致。这表明下降主要来源于图像可读性下降,而非细粒度辨别能力的缺失。尽管 BioCLIP 参数量更小,但在扩展至每个模型 200 张图像的样本后,其准确率仍领先所有 VLM 33.2–59.2 个百分点,说明专门的训练数据比模型规模更关键。然而,BioCLIP 在现场图像上的下降(18.0 点)与最佳 VLM(22.3 点)在统计上无显著差异,进一步支持图像质量变化是主要因素。开放式提示下,5.9–9.6% 的回答在语法上有效但对应的物种名称并不存在,且不同模型的虚构率排名在两套评估集上完全一致,这一现象比单点准确率更具稳健性。
点评:本研究揭示了在资源受限的现场环境中,专用数据的价值往往超过模型规模的提升。未来提升边缘 VLM 的物种识别能力,关键在于获取更多高质量、领域特定的训练图像,而非单纯追求更大的参数量。