论文

Omni 模型中的上下文展开

Context Unrolling in Omni Models

模型训练预训练

摘要

我们推出了 Omni,这是一个统一的多模态模型,经过多种模态的本地训练,包括文本、图像、视频、3D 几何和隐藏表示。我们发现这种训练可以实现上下文展开,其中模型在生成预测之前明确地跨多种模式表示进行推理。此过程使模型能够聚合跨异构模态的互补信息,有助于更忠实地近似共享的多模态知识流形并提高下游推理保真度。因此,Omni 在多模态生成和理解基准上都取得了出色的性能,同时展示了先进的多模态推理功能,包括文本、图像、视频和 3D 几何的上下文生成。