论文

多模态 QUD:来自科学数据的好奇问题

Multimodal QUD: Inquisitive Questions from Scientific Figures

模型评测基准与评测资源

摘要

复杂文档中的话语理解通常涉及不断提出和解决讨论中的问题 (QUD)。虽然 QUD 框架到目前为止主要关注文本,但科学文献本质上是多模态的:图形传达的话语目标与文本对应物不同,从而引发周围文本回答的隐含问题。在科学发现中,知道要提出正确的问题与知道如何回答这些问题同样重要,但当前模型中基本上不具备这种能力。在这项工作中,我们将 QUD 扩展到科学文献中的多模态话语,针对以下人物引发的问题:(1)好奇,即在先前背景下未解决; (2) 突出的,即与论文的研究主张相关并在论文后面讨论; (3)以视觉洞察力为基础。为了对模型生成此类问题的能力进行基准测试,我们引入了 MQUD,这是一个包含来自 56 篇科学论文的 1,250 个图形引发问题的数据集,其中包括由这些论文的原作者注释的 708 个问题。我们的实验表明,Qwen 3.5 等开源 VLM 主要提出可以仅通过图形来回答的问题。 MQUD 上的 微调 教导模型提出与科学相关的好奇问题,这些问题针对人物在论文论证中所扮演的角色。