SLAPBench:用于四指 SLAP 指纹验证的多模态 大语言模型 基准测试
SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification
摘要
四指 SLAP 指纹是一只手的食指、中指、无名指和小指的平面实时扫描印模,用于边境管制和执法中的身份验证。没有基准评估多模态 大语言模型 (MLLM) 是否可以从 SLAP 图像验证身份。我们推出了 SLAPBench,这是基于 MLLM 的四指 SLAP 指纹验证的第一个基准,由 NIST SD302b 构建,具有 7,832 对(176 个配对,7,656 个非配对)。我们在零样本、任务描述和相似性评分提示下评估了四个开源 MLLM(InternVL3-8B、Qwen2.5-VL-7B、Qwen3-VL-8B、Gemma-3-12B)和专有的 Claude Opus 4.8。提示控制验证行为。任务描述提示将所有四个开源模型崩溃到接近 100% 的错误接受率 (FAR),并且 Gemma-3-12B 在零样本下也崩溃了; Claude Opus 4.8 单独在两种二进制提示下都可以抵抗崩溃,给出最佳的二进制结果(FAR = 20.2%)。相似性评分消除了开源模型的崩溃并暴露了巨大的能力差距:Claude 达到 AUC = 0.953,Gemma-3-12B 达到 0.837,而 InternVL3-8B 是倒置的 (AUC = 0.590),Qwen2.5-VL-7B 接近随机 (0.567)。 Qwen3-VL-8B 实现了完美的分离(AUC = 1.000),我们将其视为一种诊断而不是能力:SD302b 在每个手指位置保存一次 SLAP 捕获,因此配对是交叉分辨率。匹配分辨率的控件可以保持完美的分数,排除分辨率捷径; SD302b 中不能排除的是近乎重复的检测,因为配对是一次捕获渲染两次。对性别、种族和年龄的公平调查表明,随着歧视的减弱,差距也在扩大。 SLAPBench 建立了第一个 SLAP 特定的 MLLM 基线,并表明提示控制崩溃,而模型能力控制歧视。