论文
多模态长篇对话中的细粒度片段检索
Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues
摘要
随着多模式通信平台的广泛采用,文本和图像交织的长篇对话变得越来越普遍。用户经常需要检索与特定主题相关的连贯对话片段,而不是孤立的话语。我们提出了细粒度片段检索(FFR),它可以在多模态长篇对话中定位语义相关的多话语、多图像片段。我们探索两种设置:(1)单对话中的 FFR,从给定对话中检索片段; (2)对话语料库中的FFR,从开放域场景的大规模语料库中检索。对于(1),我们引入了 F2RVLM,这是一种通过强化学习训练的基于生成的检索模型,使用多目标奖励和难度感知课程采样来增强片段连贯性。对于(2),我们开发了 FFRS,这是一个将离线片段级索引与在线检索相结合的两阶段系统。具体来说,每个对话都被分解为最小的语义片段,并通过片段嵌入模型(FEM)编码到向量数据库中;在推理时,FEM 快速召回 Top-K 候选内容,F2RVLM 执行细粒度推理以识别最相关的子内容。为了支持 FFR,我们构建了迄今为止最长的多模态对话检索数据集 MLDR,以及基于微信的真实测试集。两个基准测试的实验表明,F2RVLM 和 FFRS 在单一对话和语料库级 FFR 中始终实现卓越的性能。