模型
Reka发布Rho-1统一理解、生成与动作的研究预览
Rho-1: Collapsing the multimodal stack
概述
Rho-1是Reka从头训练的19B参数统一模型,目标是把多模态理解、生成和动作连接在持续的同一上下文中。离散专家处理文本等自回归序列,连续专家处理图像、视频、机器人动作和本体感知等连续信号,两者共享注意力及KV状态,避免仅靠外部工具串接多个独立模型。官方展示在同一上下文中理解画面、生成或修改视觉内容,以及利用动作和观测进行机器人任务。连续生成采用流匹配,基础配置使用99步,并展示蒸馏后的8步方案;这些展示及速度比较来自厂商自测,不构成跨任务通用领先的证明。当前披露为研究预览,官网邀请联系团队,本轮未确认可公开下载的权重、许可或普遍可用的API。官方同时说明长时视频存在结构漂移,静态定位能力不能直接延伸到整个视频,编辑仍有脆弱情况,原生视频分辨率为672×384。采用前需要针对任务时长、一致性、动作边界和接入条件单独评估。