论文

OmniVL-Guard Pro:用于综合视觉语言取证的工具增强代理

OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

智能体系统Agent 工具调用

摘要

现有的视觉语言伪造检测和伪造定位方法在封闭世界范式下运行,假设验证可以仅由模型完成。然而,独立的 MLLM 受到有限参数知识、静态训练语料库和有限感知分辨率的限制,在动态开放世界取证中创造了实用上限——特别是对于需要外部线索的实时事件验证和需要对本地操作进行细粒度审查的伪造分割。为了解决这些限制,我们从扩大独立模型转向超越它。我们提出 \textbf{OmniVL-Guard Pro},这是一种工具增强代理,可将统一取证从封闭世界预测扩展到开放世界线索驱动推理。 OmniVL-Guard Pro 集成了一个工具环境,涵盖实时事件搜索、局部裁剪和缩放、边缘异常筛选、人脸检测、视频帧提取和基于 SAM3 的分割。为了生成高质量的工具推理轨迹,我们引入了\textbf{树结构自进化工具轨迹生成},它通过种子引导、无引导自进化和弱暗示硬样本合成产生多样化的轨迹,产生用于训练的全谱工具推理(FSTR)数据集。我们进一步提出\textbf{检查引导代理强化学习}(CGARL),它提供过程级监督来惩罚答案正确但推理扭曲的情况。大量实验表明,OmniVL-Guard Pro 在各种任务中均实现了最先进的性能,并表现出强大的零样本泛化能力。 OmniVL-Guard Pro 的 FSTR 数据集和代码将在 https://github.com/shen8424/OmniVL-Guard-Pro 公开发布。