论文
像植物学家一样思考:用意图驱动的探究链挑战多模态语言模型
Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry
摘要
视力评估通常通过多步骤过程完成。在大多数当代领域,专家使用结构化、基于证据的自适应提问来分析图像。在植物病理学中,植物学家检查叶子图像,识别视觉线索,推断诊断意图,并进一步探讨适合物种、症状和严重程度的有针对性的问题。这种结构化探测对于准确的疾病诊断和治疗制定至关重要。然而,当前的视觉语言模型是通过单轮问答来评估的。为了解决这一差距,我们引入了 PlantInquiryVQA,这是一个用于研究植物诊断中多步骤、意图驱动的视觉推理的基准。我们形式化了一个查询链框架,将诊断轨迹建模为基于基础视觉线索和明确认知意图的有序问答序列。我们发布了一个数据集,其中包含 24,950 个专家策划的植物图像和 138,068 个问答对,并带有视觉基础、严重性标签和特定领域推理模板注释。对顶级多模态 大语言模型 的评估表明,虽然它们充分描述了视觉症状,但它们在安全的临床推理和准确的诊断方面存在困难。重要的是,结构化问题引导的询问显着提高了诊断的正确性,减少了幻觉,并提高了推理效率。我们希望 PlantInquiryVQA 成为推进研究的基础基准,以训练诊断代理像专家植物学家而不是静态分类器一样进行推理。