论文

流媒体干预:视频 大语言模型 能否纠正发生的错误?

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

模型评测基准与评测资源

摘要

学习日常技能(例如烹饪菜肴)越来越依赖在线视频等教学媒体。这为使用视频(和多模式)大语言模型 (LLM) 作为任务指导助手打开了大门。预期任务指导助手在现实世界中取得成功的一个关键能力是,它能够在出现明显错误时主动干预以指导用户。为了评估这一关键能力,我们引入了 Ego-MC-Bench(错误纠正),这是一个用于评估现实烹饪场景中反应性、逐步任务指导的基准。大量实验表明,Ego-MC-Bench 对于最先进的视频 LLM 具有很高的挑战性。我们认为一个关键原因是用于此任务的 微调 模型的训练数据的可用性有限。尽管存在广泛的烹饪视频数据集,但现有数据集缺乏错误示例以及适当的定时干预。为了帮助解决这一数据限制,我们还引入了 Ego-CoMist,这是一个反事实合成数据集,通过将非交互式烹饪视频转换为显示主动干预的监督训练示例而创建。我们表明,Ego-CoMist 上的 微调 可以带来性能提升,特别是对于更小、更高效的视频 LLM,它们非常适合在边缘设备上提供帮助。