论文

PertMind:通过细胞扰动数据的强化学习在 LLM 中引发紧急生物推理

PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data

模型训练强化学习

摘要

大语言模型 可以描述机制,但可扩展的 后训练 仍然依赖于昂贵的、手动策划的生物推理痕迹。在这里,我们表明细胞扰动图集可以成为强化学习环境,其中测量的基因反应为生物推理提供可计算的奖励。我们引入了 PertMind,它将可信轨迹监督初始化与基因、通路和格式级强化信号相结合。 PertMind 仅接受前向扰动响应预测训练,改进了看不见的细胞环境中的响应推理,同时保留了一般语言能力。它还在没有特定任务 后训练 的情况下转移到逆扰动识别、双扰动推理、表型筛选优先级和生物过程解释。 PertMind 进一步生成了支持跨多尺度下游任务的竞争性基因、细胞和供体表征的生物学特征。这些结果支持这样的假设:对实验终点的强化可以集中预训练模型已经可以使用的可重复使用的生物策略。更广泛地说,扰动衍生的强化学习提供了一种可扩展的途径,可以将扩展的实验图集转变为通用生物推理的训练环境。