论文
NLPCC 2026共享任务1概述:难度感知的多语言、多模态医学教学视频理解评估
Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation
摘要
继 NLPCC 2023--2025 中的 CMIVQA、MMI-VQA 和 M4IVQA 挑战之后,我们为 NLPCC 2026 引入了难度感知医学教学视频问答 (DA-MIVQA) 共享任务。DA-MIVQA 通过根据回答所需证据的类型和复杂性明确区分问题,扩展了之前的多语言和多模式医学视频基准。具体来说,简单的问题通常可以通过基于视频描述的文本提示来回答,而复杂的问题则需要视觉定位、程序理解和跨模式证据整合。该挑战赛包含三个赛道:单个视频中的难度感知临时答案基础 (DA-TAGSV)、视频语料库中的难度感知临时答案基础 (DA-TAGVC) 和视频语料库中的难度感知临时答案基础 (DA-TAGVC)。该数据集来自公共医学教学渠道,涵盖急救、应急、康复、护理、普通医学教育等多种场景,并经过人工验证和难度标注。本文介绍了 DA-MIVQA 的任务动机、数据集构建、评估协议、参与概述、竞赛结果和代表系统。 DA-MIVQA 为在不同的文本、视觉、时间和程序推理要求下评估医学教学视频问答系统提供了实用的基准。