论文
探索在线签名验证的视觉语言模型:零样本能力研究
Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study
摘要
视觉语言模型 (VLM) 的最新进展已经证明了其在一般视觉推理方面的强大能力,但它们在严格的生物识别任务中的适用性仍有待探索。这项工作提出了一项探索性研究,评估最先进的 VLM(GPT-5.2 和 Gemini 2.5 Pro)在签名验证挑战(SVC)基准上的零样本性能。为了实现视觉处理,原始运动时间序列被转换为静态图像,将压力信息编码为源数据中可用的笔画不透明度。此外,我们引入了一种评分协议,可以提取潜在词元概率来计算稳健的生物特征得分。实验结果揭示了取决于信号质量和伪造类型的显着性能二分法。在随机伪造场景中,零样本 VLM 实现了出色的辨别能力,GPT-5.2 在移动任务中达到了 0.32% 的等错误率,优于受监督的最先进系统。相反,在熟练的伪造场景中,任务更具挑战性,因为两个签名几乎相同,结果明显更差,并且出现了一个关键的“合理化陷阱”:思想链(CoT)推理会降低性能,因为模型会产生运动学幻觉,以将伪造伪影证明为自然变异。