论文

MiniMind-O 技术报告:开放式小型语音原生 Omni 模型

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

模型优化小模型/轻量模型

摘要

MiniMind-O 是一个基于 MiniMind 语言模型构建的开放式 0.1B 规模全向模型。它接受文本、语音和图像输入,并返回文本和流语音。该版本包括模型代码、检查点以及用于文本到音频、图像到文本和音频到音频训练的主要 Parquet 训练数据集,使完整的交互循环可以直接检查。该模型使用完整的 MiniMind 主干作为 Thinker 和由 MiniMind 块制成的独立四层 Talker。 Frozen SenseVoice-Small 和 SigLIP2 编码器提供语音和图像特征,这些特征由轻量级 MLP 投影仪映射并注入模态占位符位置。 Talker 读取中间层 Thinker 状态以及自回归八层 Mimi 代码缓冲区。说话人控制由专用说话人词元、右对齐参考编解码器提示和预先计算的 CAM++ 说话人嵌入来处理,因此语音调节仍然是音频代码上下文的一部分,而不是单独的 TTS 模块。对于 768 维 Talker,dense 和 MoE 变体在 Thinker-Talker 一致性评估中达到平均 CER 0.0897 和 0.0900,整体语音克隆相似度为 0.5995 和 0.5937。除了报告一个工作系统之外,该论文还确定了小型全向模型的三种规模关键设计选择:中间层语义桥接、发布的多模态序列格式和参数高效的八码本接口。