论文

InterView-C:同步多模态VR访谈语料

InterView-C: A Synchronized Multimodal Corpus of VR Avatar-Mediated Survey Interviews

模型评测应用与实践基准与评测资源语音识别与转写语音交互与综合语音服务

摘要

我们展示了 InterView-C,这是一个德国多模态语料库,包含完全在虚拟现实中进行的 27 次调查访谈,对话者均由化身代表。该语料库将语音交互与同步行为数据结合起来,包括凝视、头部和身体运动、面部行为、手和手指跟踪。其参考记录和语言注释在这种多模式口语交互和主要基于文本的 NLP 方法之间提供了可靠的接口。该接口很重要,因为自动转录语音可能会扭曲语言相关信息,而在现有资源上训练的下游模型在应用于转录的语音数据时可能还会面临传输挑战。因此,InterView-C 提供了所有 54 个录音的按字计时和手动后期编辑的逐字记录、访谈项目计时、问卷答复以及 1,422 个句子的否定提示和范围注释,其中 1,398 个句子进行了双重注释(提示 α=0.87;范围 α=0.81)。我们凭经验证明了这两个挑战:九个开放权重 ASR 系统不成比例地错误识别简短的封闭答案和数字词,而在现有语料库上训练的否定模型在我们转录的访谈中显示出比在 InterView-C 注释上训练的模型更低且高度可变的性能。因此,InterView-C 能够对口语交互进行语言分析,同时保持其与丰富的多模态行为的一致性。

InterView-C:同步多模态VR访谈语料:论文原图
图 2:具有受访者 3D 凝视点的虚拟访谈环境,按停留时间从蓝色(较短)到红色(较长)进行着色。