论文

预见看不见的事物:叶子化石图像的阿模态重建

Foreseeing the Invisible: Amodal Reconstruction of Leaf Fossil Images

模型训练监督微调与指令调优

摘要

叶子化石很少能完整保存——沉积岩隐藏、破坏和侵蚀了叶片,但古植物学依赖于叶子的完整形状和轮廓。我们将缺失组织的恢复视为非模态重建,并提出了 AmodalDINO,这是一种多头密集预测模型,可以从单个 RGB 图像中预测四个掩模:可见叶、非模态完整叶、非模态主静脉和细静脉。与之前所有的 amodal 工作基本上不同,AmodalDINO 没有给出可见的掩模。它联合预测可见区域和非模态区域,因此在运行时不需要上游实例分段器。两个简单但有效的更改使模型适应非模态分割任务:以较小的学习率完全微调 DINOv3 ViT-L/16,而不是冻结它,并将辅助脉络头附加到叶头旁边。这两个变化使模型能够先了解叶子的结构形状。仅在合成叶子化石图像上进行训练,AmodalDINO 在验证集上达到 95.0% Dice / 90.5% IoU,并且可以很好地转移到真实化石标本。剥离到两个头后,相同的配方可以在两个基准数据集上运行,在 KINS 上达到 85.05 完整 MIoU / 66.65 遮挡 MIoU,在 COCOA-cls 上达到 80.90 / 38.15。该模型也很实用:通过量化为 4 位权重,它可以在浏览器中完全离线运行,与原始模型的 IoU 为 0.910 相匹配。我们还添加了基于标尺的校准来估计表面积,以及本地设备上活叶的生成可视化。