论文

InVitroVision:使用自然语言自动描述胚胎发育的多模态人工智能模型

InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

应用与实践行业应用

摘要

人工智能 (AI) 在 IVF 中的应用在提高决策的一致性和标准化方面显示出了希望,但通常依赖于注释数据,并且没有利用 IVF 数据的多模态性质。我们研究了是否可以微调基础视觉语言模型来预测胚胎形态和发育的自然语言描述。使用公开的胚胎延时数据集,我们对 PaliGemma-2(一种多模态视觉语言模型)进行了微调,仅用 1,000 张图像和相应的说明文字来描述胚胎形态、胚胎细胞周期和发育阶段。我们的结果表明,经过微调的模型 InVitroVision 在整体指标上优于商业模型 ChatGPT 5.2 和基础模型,并且随着更大的训练数据集,性能有所提高。这项研究证明了基础视觉语言模型在数据有限的情况下推广到 IVF 任务的潜力,从而能够预测胚胎形态和发育的自然语言描述。这种方法可能有助于使用 大语言模型 从相关出版物和指南中检索信息和科学证据,并对 IVF 中多个下游任务的小样本适应具有影响。