论文
K9-Bench:在以犬类为中心的视频上评估多模态 LLM
K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos
摘要
MLLM 在不同的输入(例如图像、视频、音频和文本)中表现出了强大的零样本能力。这些模型的一个重要但尚未充分探索的应用在于理解和建模以动物为中心的场景。由于动物是数百万家庭不可或缺的一部分,因此在以宠物为中心的任务上对下一代人工智能模型进行基准测试,从识别求救信号到启用响应式机器人伴侣,对于构建可以与我们一起工作的人工智能系统至关重要。我们推出了 K9-Bench,这是一个专注于现实世界的家养狗视频的新颖基准,专门通过 907 个视频中的约 5000 个问答对来理解犬类的动作和交互,涵盖 5 个不同的任务类别,测试 MLLM 中以犬类为中心的长篇多模态推理。为了创建这个数据集,我们提出了一个可扩展的、由 VLM/LLM 支持的数据生成管道,该管道自动从网络中挖掘以犬类为中心的视频,并策划需要对犬类动作和时间扩展的交互序列进行细粒度、多跳推理的 QA 对。我们实施偏差缓解策略,旨在消除 VLM 在数据集管理过程中引入的偏差。通过广泛的实验,我们发现前沿 MLLM 在以犬类为中心的任务上表现出有限的零样本性能:尽管最先进的闭源模型优于开源模型,但它们仍然难以对长期视野中的微妙姿势和交互线索进行组合推理。我们观察到,通用的思维链提示对于这种长期推理只能提供适度的性能。除了用于犬类活动分析的新颖数据集之外,K9-Bench 还提供了通用数据集构建管道,可适应其他低数据领域进行定量分析。我们的项目网站位于:https://ogmenrobotics.github.io/K9Bench。