论文
LIMSSR:训练时间不完整多模态观测下 LLM 驱动的序列评分推理
LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations
摘要
现实世界的多模式学习常常因缺少模式而受到阻碍。虽然不完整多模态学习(IML)已经获得关注,但现有方法通常依赖于训练期间全模态可用性的不切实际的假设来提供重建监督或跨模态先验。本文解决了训练时不完整观察下 IML 更具挑战性的设置,这排除了对完整数据的“上帝视角”的依赖。我们提出了 LIMSSR(LLM-Driven Incomplete Multimodal Sequence-to-Score Reasoning),这是一个将这一挑战重新表述为条件序列推理任务的框架。 LIMSSR 通过提示引导上下文感知模态插补和多维表示融合,利用 大语言模型 的语义推理功能,从可用上下文中推断潜在语义,而无需直接重建。为了减轻幻觉,我们引入了掩模感知双路径聚合来动态校准推理不确定性。对三个行动质量评估数据集的广泛实验表明,LIMSSR 在不依赖完整训练数据的情况下显着优于最先进的基线,为数据高效的多模式学习建立了新的范式。代码可在 https://github.com/XuHuangbiao/LIMSSR 获取。