论文
JoyAI-VL-Interaction:实时视觉语言交互智能
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence
摘要
现实世界中的许多时刻并不等待用户询问。安全监视器起火,视频通话中表情闪烁,或者观众想要的产品在直播中闪现。然而,今天的大型模型在设计上仍然大多是回合制的:它们仅在被处理时才回答,甚至看起来交互式的视频通话应用程序仍然作为问答系统运行,仅在轮询或提示时做出反应。我们主张一种不同的范式:一种像人一样存在于世界上的模型。它持续观察正在发生的事情,自行决定是否说话或保持沉默,实时交互,并在问题困难时委托给后台模型。为了推进交互模型及其跨领域的采用,我们做出了两项完全开源的贡献。首先,我们发布了 JoyAI-VL-Interaction,一个 8B 规模、视觉优先的 VL 交互模型。该模型在内部做出响应决策,选择每一秒保持沉默、响应或委托给后台模型,并且它擅长视觉触发响应和时间意识。我们将其与可转移的训练方案配对,从中出现我们从未接受过训练的功能,例如引导购物者更改应用程序屏幕或通过幻灯片即兴演讲。其次,我们发布了一个围绕该模型构建的完整的、可部署的系统。该系统将任何正在进行的视频传输到模型中,使其真实地呈现在世界上。所有其他组件都是可插拔的,包括 ASR/TTS 模块、内存、可视化 UI 以及可以连接到任何 API 或代理的后台大脑。在六个真实场景中,人类评分者更喜欢 JoyAI-VL-Interaction,而不是豆宝和双子座的应用内视频通话助手。据我们所知,这是第一个开放的、视觉驱动的交互模型及其训练配方、数据和完整的可部署系统。