论文
ForensicZoom:让多模态LLM按需放大图像核验伪造证据
ForensicZoom: Adaptive Visual Inspection with Multimodal LLMs for Industrial-Grade Face Forgery Detection
摘要
可靠的人脸伪造检测对在线身份验证安全至关重要:漏检会损害安全,过多误报会干扰正常用户。专用取证检测器表现较强,但可解释性有限;多模态LLM具有语义理解与可解释推理能力,在伪造检测中却仍明显较弱。我们认为,关键局限在于视觉证据获取:细微取证痕迹在标准分辨率下可能表现不足,所有案例都采用更高分辨率则计算效率低。因此,我们提出ForensicZoom,一个工业级MLLM自适应视觉检查框架。它先为通用MLLM加入取证感知视觉表示,并将语言模型与这些特征对齐。核心NEED_ZOOM机制使模型在初始证据不足时,自主请求可疑区域放大视图,将固定单轮分类转为自适应多轮取证推理。放大行为通过奖励塑形学习,在检测准确率和不必要视觉检查之间平衡,把额外计算集中于困难案例。最后的归因优化阶段改善自然语言取证报告,同时保留检测表现。在大规模工业身份核验数据上,ForensicZoom在0.1%误报率下达到超过97%的真阳性率,明显优于专用检测器和现有MLLM方法,并产生可操作的取证归因。这些结果展示准确、可解释且可扩展的MLLM人脸伪造检测路径。