论文

让科研图示讲清自身内容:依据论文生成科学图示讲解视频

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

模型评测基准与评测资源

摘要

科研图示把复杂流程压缩到一张图中,但理解它需要依据论文逐步讲解,并让讲解与图中高亮区域对应。现有视频生成系统与基准尚缺少这一能力。研究提出依据论文的图示到视频生成任务:从图示及对应论文生成带解说、能定位到图示区域的讲解视频。MINARD流程先生成依据论文的解说,再按顺序将解说定位到各个图示区域。研究还发布FigTalk基准,并设计顺序与组件层面的区域定位指标。在FigTalk上,MINARD生成的讲解自然且忠实于论文内容;在自动与人工评测中,依据讲解对图示进行空间定位的效果优于已有方法。