论文

连接组学中突触检测和校对的视觉语言模型基准测试

Benchmarking Vision-Language Models on Synapse Detection and Proofreading in Connectomics

模型评测模型能力评测

摘要

我们根据注释者在检查连接组学中的电子显微镜图像时所做的决策对视觉语言模型(VLM)进行了基准测试:突触检测(存在和极性)和校对(分割错误和合并错误)。对于突触检测,我们在我们使用公共资源构建的数据集上,针对专业模型,在零样本、四样本上下文学习和 LoRA 设置下评估了跨不同架构和大小的 19 个开放模型和 2 个封闭模型。为了校对,我们在 ConnectomeBench2 数据集上评估了 3 个开放模型和 2 个封闭模型,以及从果蝇和小鼠到人类和斑马鱼的跨物种转移。大多数模型都有可能是零样本;一些例子主要帮助了封闭的和最大的开放的。 LoRA 在数千个标签上带来了开放模型与专业模型的水平。当对未见过的物种进行评估时,最适合的 VLM 在识别合并错误方面优于使用相同数据训练的专业模型。该项目将在接受后公开。