论文

空间动作审查:用于审核电子显微镜中语言到动作交接的可视化分析仪表板

Spatial Action Review: A Visual Analytics Dashboard for Auditing Language-to-Action Hand-offs in Electron Microscopy

模型评测评测方法与指标

摘要

多模态大语言模型(MLLM)越来越多地被探索作为科学图像分析的接口,其中视觉问答(VQA)响应可以与指导下游阶段的空间输出配对。主管读取语言答案,而下游工作流程(例如分段或区域审查)则使用点集输出。我们将这种从检查答案到依赖其点动作的转变称为“语言到动作的交接”。当答案正确而配对操作错过下游所需的注释对象时,就会发生静默故障,因此基于答案的监督会清除操作不可靠的区域。我们推出了 Spatial Action Review,这是一个可视化分析仪表板,用于审核电子显微镜 (EM) 线粒体分析中的这种故障模式。它通过答案-动作分类账、按数据集的任务风险图和图像区域审计视图链接成对的答案-动作记录,将聚合模式与图像证据连接起来,同时可调节的动作-可靠性门支持重新审计。审查以人类与人工智能的交接结束,主管记录该行动是否被接受、升级、受到更严格的控制或标记为模型修订。在来自适应 EM 的 Qwen3-VL 案例研究运行的 541 个图像区域中,点操作在 54.4% 的记录中未通过门且具有正确的 VQA 响应,所有记录中的 27.4% 是静默失败。正确答案与可靠操作的概率仅高出 5.8 个百分点,引导区间跨越零;答案正确性和对象覆盖率之间的点二列相关性为 0.061。这种弱耦合在 753 个匹配图像区域的五种模型条件下持续存在。空间行动审查使答案与行动的不匹配变得可见,并将其与图像证据和记录的决策联系起来,然后 MLLM 输出进入自主科学工作流程。