论文

可在端侧部署的视觉语言模型能识别物种吗

Can Edge-Deployable Vision-Language Models Identify Species?

模型评测鲁棒性、公平性与可信度评测

摘要

野外自动相机通常在连接有限或没有连接的边缘硬件上运行,这使得小型、可本地部署的视觉语言模型(VLM)(而不是前沿规模的模型)成为评估物种识别的实际相关类别。我们测试了与部署相关的 2--8B 范围内的模型是否具有真正的分类学知识,在 96 种任务上针对特定领域的专家 BioCLIP(300M 参数)评估了四个此类 VLM(Qwen3-VL 2B/4B/8B、Gemma3 4B),在两个独立采样的评估集上将干净的 iNaturalist 照片与来自 6 个公开数据集合(链接见原文)的野外自动相机图像进行比较。所有模型识别物种的能力都远高于随机猜测,但每个模型(通用模型或专业模型)在野外图像上都会急剧退化(领域差距为 9.6--26.6 个百分点,在分类水平和两个评估集上保持一致),表明退化反映了一般图像的易读性,而不是细粒度的辨别失败。尽管 BioCLIP 的规模小得多,但它的性能远远优于每个测试的 VLM(每个模型在扩展的 200 个图像样本中高出 33.2--59.2 个百分点),这表明这种差距反映了专门的训练数据而不是模型规模;然而,BioCLIP 自己的域差距(18.0 个百分点)在统计上与最佳 VLM(22.3 个百分点)没有什么区别,这表明从干净到现场的退化本身是图像质量转变的一个特性,而不是通用模型的弱点。在开放集提示下,5.9--9.6% 的回答在语法上有效,但在分类学上不存在物种名称;模型之间的相对虚构率排名在两个评估集中都准确复制,这是比任何单点估计更可靠的发现。