论文

视觉语言模型对农业的了解比它们所显示的要多,基于标准的验证缩小了差距

Vision-language models know more about agriculture than they show and rubric-grounded verifications close the gap

模型推理推理验证与自校正

摘要

视觉语言模型(VLM)显示出农业分类的前景,但在疾病、害虫、损害、质量和物种识别方面的零样本性能仍然很差,并且尚不清楚这是否反映了弱视觉特征或未能将它们与领域知识联系起来。 We build a benchmark of 116 datasets, 834 classes, and 8,324 images spanning these tasks to isolate where the gap arises.线性探测表明,VLM 视觉编码器已经对农业特征进行编码,几乎与自监督 DINOv3 基线一样可分离,从而排除了弱视觉表示作为主要瓶颈的可能性。将每个模型以预言机参考描述(其参数知识的上限)为条件,弥补了无辅助下限留下的大部分空白,这表明 VLM 对农业的了解已经比它们所显示的要多。为了在推理时没有预言描述的情况下缩小这一差距,我们围绕固定的、每个任务的诊断标题构建测试时推理:模型生成 $K$ 候选响应,并且概率枢轴锦标赛 (PPT) 验证器根据该标题成对评分,选择最佳响应。这几乎使判断的 F1 下限翻倍,并且在多项任务中匹配或超过上限,特别是将 Gemma 4 E4B-it's 疾病 F1 推至 0.71,高于其自身的上限 0.60。然而,验证者的字母尺度置信度得分与其预期效果相反:过滤到最有信心的预测不会提高准确性,并且与测试的每个模型和池大小的正确性呈负相关,因此该得分不能作为预测不确定性的衡量标准,并且大多数观察到的增益可能来自基于标题的生成而不是成对验证。