论文

Yuvion VL:对抗性内容和人工智能安全的多模式基础模型

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

模型训练监督微调与指令调优

摘要

通用模型通常难以可靠地识别和理解现实世界的多模式风险,这很大程度上是由于内容和人工智能安全固有的多模式对抗性质。我们推出了 Yuvion VL,这是一个专为内容和 AI 安全而构建的多模式 大语言模型 系列,具有指令调整和面向推理的变体。 Yuvion VL 通过将安全性视为本质上的对抗性和多模式问题,并围绕对抗性鲁棒性设计整个流程,解决了这一差距。对于数据构建,我们开发了一个自动化管道,将对抗感知数据合成与多阶段质量控制相结合,生成大规模、高质量的多模态样本,并辅以领域知识和推理注释。对于训练,我们采用三阶段管道,包括对风险概念跨模式对齐进行持续预训练,指导 后训练 执行生产级安全任务,并推理 后训练 以增强复杂任务中的可解释性和性能。我们进一步引入了Confuse-then-Contrast 微调,这是一个对比框架,可以挖掘模型特定的混淆并构建多图像对比组,以强制明确区分细粒度的视觉语义元素,使模型能够区分在对抗性安全任务中具有不同安全含义的视觉相似案例。为了支持严格的评估,我们进一步引入了 Yuvion VL RiskEval (YVRE),这是一个涵盖各种开放和内部评估的基准集合,重点关注内容和人工智能安全、对抗鲁棒性和现实世界的能力要求。实验表明,Yuvion VL-32B 实现了业界领先的安全性能,超越了同等规模的开源模型和最好的闭源商业模型,同时保持了可比的通用能力。