论文

Xuanwu:将通用多模态模型演进为面向内容生态的工业级基座

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

应用与实践内容创作

摘要

近年来,多模态大模型在通用基准上的表现持续提升。然而,在真实世界的内容审核与对抗场景中,由于细粒度视觉感知能力有限以及对长尾噪声建模不足,主流模型仍然面临泛化能力退化和灾难性遗忘问题。本文以 Xuanwu VL-2B 为案例,展示如何将通用多模态模型发展为面向内容生态的工业级基座模型。该模型采用紧凑的 InternViT-300M + MLP + Qwen3 1.7B 架构,在约 2B 参数预算内兼顾细粒度视觉感知、语言语义对齐与部署成本。为了在业务专用性与通用能力保持之间取得平衡,我们开发了数据迭代与筛选机制,并通过预训练、中期训练(mid-training)和后训练的渐进式三阶段流程对模型进行训练。消融实验与离线业务评估表明,Xuanwu VL-2B 在七项 OpenCompass 多模态指标上取得平均 67.90 分(对比 InternVL 3.5 2B 的 64.27),在七项独立业务审核任务上取得平均 94.38% 的召回率,并在具有挑战性的对抗 OCR 场景中对违规文本取得 82.82% 的加权总体召回率,超过 Gemini-2.5-Pro(76.72%)。这些结果表明,在有限的参数预算下,Xuanwu VL-2B 在业务对齐、视觉感知、通用能力保持与部署成本之间取得了切实可行的平衡。

Xuanwu:将通用多模态模型演进为面向内容生态的工业级基座:论文配图
图2:Xuanwu VL-2B:InternViT-300M视觉主干与Qwen3 1.7B语言主干经MLP投影器连接。