论文

Phoenix-VL 1.5 中型技术报告

Phoenix-VL 1.5 Medium Technical Report

模型训练预训练

摘要

我们推出 Phoenix-VL 1.5 Medium,这是一个 123B 参数的原生多模式和多语言基础模型,适合区域语言和新加坡环境。它作为主权人工智能资产而开发,表明可以在对广谱智能和对齐的影响最小化的情况下实现深度领域适应。使用本地化的 1 万亿个词元多模态语料库在 Mistral Medium 3.1 上进行持续的预训练,然后是 2500 亿个词元的长上下文扩展阶段。随后的 后训练 纳入了新颖的人工注释新加坡多模式数据集和有关新加坡文化、知识和立法的精选文本语料库,总计 220 亿个词元。通过在线直接偏好优化额外执行了 50 亿个模型对齐词元。 Phoenix-VL 1.5 Medium 在新加坡多式联运、法律和政府政策基准上实现了其规模的最先进的性能,同时在一般多式联运智能、多语言和 STEM 基准上保持全球竞争力。我们还引入了一个新颖的评估套件,其中包括本地化知识基准以及制度上一致的模型行为和安全框架。我们报告数据管理原则、训练方法,并重点介绍基准和推理性能。