论文

Valley3:面向电商扩展全模态基础模型

Valley3: Scaling Omni Foundation Models for E-commerce

模型训练预训练

摘要

在本工作中,我们提出Valley3,一个为多样化全球电商任务开发的全模态多模态大语言模型(MLLM),具备跨文本、图像、视频和音频的统一理解与推理能力。Valley3的一个关键特性是其面向电商的原生多语言音频能力,它通过扩展视觉-语言模型而开发,以更好地支持关键的视听任务,尤其是短视频场景。为实现这一目标,我们精心设计了四阶段的全模态电商继续预训练流水线,Valley3由此逐步获得音频理解、跨模态指令遵循、电商领域知识和长上下文推理能力,最终演进为面向多样电商场景的全模态模型。随后,我们通过后训练进一步改进Valley3,以促进具有可控推理模式的长链推理,提供一个非思考模式和三个不同层次的思考级别,从而在简单场景的推理效率与复杂应用的深度推理之间取得平衡。此外,我们为Valley3配备智能体搜索能力,以主动调用搜索工具并为电商深度研究任务获取任务相关信息。为全面评估Valley3的能力,我们构建了覆盖6个任务的全模态电商基准。实验结果表明,Valley3在我们的内部和开源电商基准上持续优于强大基线,同时在通用领域基准上也保持竞争力。

Valley3:面向电商扩展全模态基础模型:论文配图
图 1:Valley3 的架构概览。它建立在 Qwen3-VL 主干之上,并通过音频变压器对其进行扩展以进行音频编码。音频嵌入通过基于 MLP 的连接器与视觉语言主干对齐,然后与视觉和文本标记连接到统一的输入空间中,从而实现全模式理解。