论文
AURA:通过视频流始终在线的理解和实时帮助
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
摘要
视频大语言模型(VideoLLM)在许多视频理解任务上取得了强大的性能,但大多数现有系统仍然处于离线状态,并且不太适合需要连续观察和及时响应的实时视频流。最近的流式 VideoLLM 取得了进展,但当前的方法通常依赖于解耦的触发响应管道或仅限于字幕式叙述,从而降低了其开放式问答和长视野交互的有效性。我们提出了AURA(Always-On Understanding and Real-Time Assistance),这是一种端到端流媒体视觉交互框架,使统一的VideoLLM能够持续处理视频流并支持实时问答和主动响应。 AURA 集成了上下文管理、数据构建、训练目标和部署优化,以实现稳定的长视野流交互。它在流媒体基准测试中实现了最先进的性能,并支持实时演示系统,其中 ASR 和 TTS 在两个 80G 加速器上以 2 FPS 运行。我们发布了 AURA 模型和实时推理框架,以方便未来的研究。