论文
EgoVoice:来自以自我为中心的多模式流的主动语音协助
EgoVoice: Proactive Spoken Assistance from Egocentric Multimodal Streams
摘要
可穿戴增强现实 (AR) 助手正在朝着持续的现实世界交互方向发展,它们通过第一人称视频和音频感知用户的活动,并在无需明确询问的情况下提供及时的语音指导。虽然主动视频助理、语音对话系统和以自我为中心的任务理解都在迅速发展,但现有系统并没有解决从连续的第一人称流中决定何时说话以及说什么的共同问题。我们推出 EgoVoice,一个用于培训和评估主动的以自我为中心的语音助手的框架。根据真实人类教练的 HoloAssist 视频录制,我们通过源分离和语音重新合成构建干净的音频流,并将每个视频会话转换为模型必须在每个时刻决定是保持沉默还是提供语音指导的格式。我们利用数据对全模式LLM进行微调,并通过直接偏好优化进一步改进其主动干预行为。跨封闭和开源模型的实验表明,现有系统很少 产生适时、有意义的主动干预,而 EgoVoice 在干预时机、内容相关性和人类偏好方面相对于零样本骨干网产生了明显的改进。