论文
GuideMe:流媒体视频中的多域任务指导和干预
GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video
摘要
虽然多模态 大语言模型 (MLLM) 擅长离线视频理解,但一个有趣的问题是,它们距充当实时程序教练还有多远,仍然未知。此类角色通常需要 MLLM 持续监控执行情况、检测错误并在闭环交互中提供纠正指导。在本文中,我们构建了 GuideMe,这是第一个流视频多领域基准测试,支持闭环交互式任务指导的 MLLM 训练和评估。它包含 2,458 个视频,跨越 223.7 小时,涵盖不同领域(例如烹饪、物体操作、日常生活指导和健身),以及 47,775 个交互样本,涵盖下一步说明、完成反馈、错误检测和纠正指导。为了评估 GuideMe 上的现有模型,我们设计了一个三部分评估框架来衡量代表性 MLLM 的能力,其中包括用于序列级对齐的时间语义二分匹配、用于干预时间的行为分类以及用于内容质量的 LLM-as-A-Judge。大量的实验凸显了一个关键的性能不对称性:尽管现有的 MLLM 擅长提供指令,但始终无法识别执行错误并以纠正反馈进行响应。代码和数据发布于https://fawnliu.github.io/project/guideme。