论文

Ryze:来自生物医学论文的证据增宽数据合成

Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

模型训练合成数据

摘要

通用VLM在生物医学研究中仍不可靠,因为科学论文中的有效答案依赖分散在插图、表格、统计图、题注和指代文本中的证据。现有后训练流水线的瓶颈在于昂贵的专家标注,以及丢弃这种证据结构的合成数据。我们提出Ryze,一个将原始生物医学论文转化为证据增广训练集和领域专用VLM的全自动系统。Ryze合成带有完整支撑证据(视觉元素、题注、抽取结构和指代段落)的问答对,通过感知图表的抽取和基于LLM的清洗减少版面与OCR错误,并采用结合监督微调与强化学习的进度门控后训练策略。从Qwen3-VL-8B出发,Ryze以不到200美元的成本训练出BioVLM-8B,在LAB-Bench上取得48.0%加权准确率,比基础模型高出12.6个百分点(pp),并领先GPT-5.2 3.8个百分点。我们以开源方式发布Ryze以及训练好的BioVLM-8B模型。

Ryze:来自生物医学论文的证据增宽数据合成:论文配图
图 2:证据丰富的数据合成管道。源 PDF 经过文本区域检测、基于 LLM 的 OCR 校正、标题匹配和术语标准化。由此产生的证据丰富的数据集保留了下游 QA 生成的源材料的完整结构和语义保真度。