论文

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型

Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications

摘要

我们介绍 Yuan3.0 Flash,一个开源的混合专家(MoE)多模态大语言模型,具有 3.7B 激活参数与 40B 总参数,专为提升企业导向任务的表现而设计,同时在通用任务上保持有竞争力的能力。为解决大型推理模型(LRM)中常见的过度思考现象,我们提出 Reflection-aware Adaptive Policy Optimization(RAPO),这是一种能有效调节过度思考行为的新型强化学习训练算法。在检索增强生成(RAG)、复杂表格理解与摘要等企业导向任务中,Yuan3.0 Flash 持续取得更优表现。此外,它在数学、科学等领域展现出强大的推理能力,以约 1/4 至 1/2 的平均 token 达到与前沿模型相当的准确率。Yuan3.0 Flash 已完全开源,以促进进一步研究与真实世界部署:https://github.com/Yuan-lab-LLM/Yuan3.0。

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型 配图
图 2:Yuan3.0 Flash 与基于 MoE 的语言骨干总体架构。左图描绘了所提出的 Yuan3.0 架构,它由三个不可或缺的组件构成:(1) 负责处理与编码输入图像的 ViT 编码器;(2) 带 SwiGLU 激活的轻量级 MLP 投影器,用于将视觉特征与文本 token 空间对齐;(3) 充当语言解码器的基于 MoE 的语言模型。右图展示了带有基于定位过滤的注意力(Localizing Filtering-based Attention, LFA)的语言骨干