论文
超越描述文本:生物医学多模式持续预训练的基于上下文的重建
Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining
摘要
生物医学数字不仅通过标题来解释,还通过讨论它们的正文段落来解释。然而,当前的多模态语料库通常将图形简化为孤立的图像标题对,从而丢弃了这一关键的上下文。现有的管道要么忽略此上下文,要么在不强制执行支持每个附件的图形引用的情况下附加它,这可能会创建不受支持的图像文本附件和不连贯的话语。我们引入了基于上下文的重建,这是一种基于源的框架,可将 PubMed 中央开放获取 (PMC-OA) 记录转换为引用连贯的交错序列。它恢复标题和源文本,仅通过文章本机图形引用附加上下文,修复不连续的上下文,并修剪不受支持的图像。从这些重建序列开始,PMC-InterCPT 首先过滤记录的文本质量和医学相关性,然后应用证据感知分配形成 9.63B 词元语料库,用于生成医学 MLLM 的持续预训练 (CPT)。借助固定监督的 微调 (SFT),PMC-InterCPT 将 Qwen3.5-4B-Base 比词元匹配的原始源代码控制提高了 1.46 个医学平均点和 3.11 个一般/科学平均点,并超过了 42% 的原始数据运行。增益转移到 Qwen3.5-2B-Base 和 LLaVA-OneVision-1.5-4B-Base。受控消融表明,基于上下文的重建,而不是简单地附加文章上下文或缩放原始数据,是有用的生物医学多模式 CPT 的核心。