论文
DeepTaxon:用于统一物种识别和发现的可解释检索增强多模式框架
DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery
摘要
在数以万计的视觉上相似的类群中识别生物学物种,同时在开放世界环境中发现未知物种仍然是生物多样性研究的基本挑战。当前的方法将识别和发现视为单独的问题,分类模型假设封闭集,而发现依赖于基于阈值的拒绝。在这里,我们介绍 DeepTaxon,这是一种检索增强的多模式框架,它通过对检索到的视觉证据进行可解释的推理来统一物种识别和发现。给定查询图像,DeepTaxon 从检索索引中检索前 $k$ 候选物种,每个物种具有 $n$ 示例图像,并执行思想链比较推理。至关重要的是,我们将发现重新定义为一个显式的、基于检索的决策问题,而不是一个隐式的参数记忆问题。当且仅当检索索引缺乏足够的证据来识别时,样本才是新颖的,因此每次检索自然会产生分类或发现标签,而无需手动注释,从而为这两项任务提供自动监督。我们通过有监督的 微调 在合成检索增强数据上训练框架,然后对硬样本进行强化学习,将高召回率检索转换为可扩展到大量分类词汇的高精度决策。对大规模分布内基准和六个分布外数据集的广泛实验证明了识别和发现方面的持续改进。消融研究进一步揭示了候选计数 $k$ 和样本计数 $n$ 的有效测试时间缩放、向未见域的强大零样本传输以及跨检索编码器的一致性能,从而为生物多样性研究建立了可解释的解决方案。