论文
使用视觉语言模型进行 XRF 到光学视场的定位
XRF-to-Optical Field-of-View Localization with Vision Language Models
摘要
配准使用不同显微镜模式获取的图像对于关联同一样本的互补测量至关重要。在相关 X 射线荧光 (XRF) 和光学显微镜中,XRF 图通常仅覆盖从相同或相邻组织切片获取的光学图像的一小部分区域。视场 (FOV) 定位是必要的,但当不同模式的外观和结构不同时,可能会很困难。在这里,我们在代表相同部分高对应性和相邻部分低对应性成像的两个数据集上评估 无需训练 视觉语言模型 (VLM) 定位。我们测试无约束和元数据约束的搜索,并将 VLM 与几何控制、经典模板匹配和两种替代 无需训练 方法(DINOv2 和 multiGradICON)进行比较。直接 VLM 提示会产生与内容相关的空间信号,但单独使用并不可靠。当保留跨模态结构时,经典匹配是最准确的,但在低对应集合中则失败。提议和验证工作流程使用重复的 VLM 预测作为候选,并使用基于图像的相似性来选择最终位置。该工作流程在低对应范围内恢复了有用的定位。