论文

InteracVid:从实时聊天视频构建真正的交互式视听响应数据集

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

模型训练合成数据

摘要

大语言模型 使文本成为人类与人工智能交互的默认媒介,但仅靠文本无法表达多模式助手、化身和实体代理所需的全方位响应。虽然最近的音视频生成模型可以合成高保真同步内容,但现有的监督很大程度上是描述性的:模型被训练来按描述生成内容,而不是产生由外部用户交互引起的视听响应。我们引入了 \textbf{InteracVid},\emph{第一个解决这种缺失监督问题的开源大型数据集},以便每个样本都将前面的视听上下文和外部刺激与随后的真实交互响应结合起来。我们设计了一个元数据感知管道,可以从长而嘈杂的直播中提取交互式剪辑,从超过 \textbf{59K} 直播视频中生成超过 \textbf{454K} 上下文查询响应三元组,并涵盖以对话为中心、以对象为中心、程序化、具体化和基于屏幕的场景。一项十位评估者的人类研究证实,对于真实的查询和重构的查询,提取的交互都是因果的、自然的且在时间上完整的。在 \textbf{100} 真实实时聊天查询的测试基准上,InteracVid 上的 微调 改进了交互规划和音频视频响应生成,并且独立的人工评估再现了系统排名和通过我们的自动判断获得的结论。这些结果强调交互结构化数据是交互式多模态生成的关键基础。