论文

FigAct:将科学数据转化为活跃的画布以进行解释

FigAct: Turning Scientific Figures into Active Canvases for Explanation

应用与实践科学研究

摘要

科学图形旨在以视觉方式传达信息,但 MLLM 通常通过将其视觉内容翻译回文本来解释它们。这需要读者手动将结果解释映射回图中。受人们呈现视觉信息方式的启发,我们引入了 FigAct,这是一个框架,通过直接作用于现有的图形元素,将静态科学图形转换为问题条件的视觉呈现。就像人类演示者一样,FigAct 会生成一系列简短的叙述,将每个叙述建立在相应的视觉证据中,并应用视觉动作来引导观众的注意力。我们开发了一种分层搜索策略来实现高效的元素本地化,将词元使用量减少了大约 40$\times$。我们使用三个特定于任务的奖励来进一步训练 FigAct-8B,以提高grounding精度、搜索效率和渲染质量。我们进一步根据现实世界科学论文中的数据建立了一个经过人类验证的基准,以评估 MLLM 生成有根据的视觉解释的能力。我们的结果证明了 FigAct 的有效性,并表明将科学图表视为演示画布可以使解释更清晰、更容易理解。