论文

StoryTR:结合心智理论推理的叙事中心视频时序检索

StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning

模型评测基准与评测资源

摘要

当前的视频时刻检索(moment retrieval)擅长以动作为中心的任务,却难以处理叙事内容。模型能看见\textit{正在发生什么},却无法推理\textit{它为何重要}。这一语义鸿沟源于\textbf{心智理论(Theory of Mind, ToM)}的缺失——即从表层观察推断隐含意图、心理状态与叙事因果的认知能力。我们提出\textbf{StoryTR},首个要求ToM推理的视频时刻检索基准,包含来自叙事类短视频(shorts/reels)的8.1k样本。这类视频是理想的测试平台:其高信息密度通过微妙的多模态线索编码含义。例如,配合一声叹息的一瞥与单独的一瞥承载完全不同的语义。然而仅有多模态感知并不足够,需要ToM才能解读出角色"微笑"可能实际上是在"掩饰敌意"。为教会模型这种推理能力,我们提出一个\textbf{Agentic Data Pipeline},生成带有显式三层ToM链(意图解码、叙事推理、边界定位)的训练数据。实验揭示了这一推理鸿沟的严重程度:Gemini-3.0-Pro在StoryTR上仅取得0.53的Avg IoU。然而,我们基于ToM引导数据训练的7B \textbf{Shorts-Moment}模型较基线提升15.1%的相对IoU,证明\textit{叙事推理能力比参数规模更重要}。

StoryTR:结合心智理论推理的叙事中心视频时序检索:论文配图
图 1:我们的叙事短片(短剧/短片)的原生多模态感知管道概述。我们利用互补的基础模型:Gemini-3.0-Pro 用于高质量注释,ARC-Hunyuan 用于高效特征提取和训练。该管道通过多模态编码处理短剧视频,生成具有详细推理日志的时间定位结果。