论文
用于寻找简单而有效的转录组扰动预测器的知识图和推理 LLM
Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors
摘要
对于虚拟细胞模型来说,预测看不见的基因敲除扰动对转录组基因表达的影响仍然是一个极具挑战性的问题。最近通过利用生物知识图提供类似扰动的概念取得了进展,从而可以改进训练扰动集之外的外推法。在这项工作中,我们证明了利用这些假设的最简单模型(知识图谱中的 K 最近邻)在此任务上实现了极具竞争力的性能,并且可以使用通过强化学习 (RL) 优化的 LLM 来进一步改进以实现预测性能。具体来说,我们发现 K 最近邻方法在分布外扰动预测方面击败了几乎所有方法,并且当通过 RL 训练推理 LLM 以对邻域进行更改时,它获得了与 Replogle 等人的细胞系上当前最先进方法相当的性能。 (2022)。我们还证明,强化学习训练提高了 LLM 在差异表达预测下游任务上的性能,尽管没有直接对此进行训练。总的来说,这些发现证明了知识图作为模型先验的有效性,并显示出 RL 可以将 LLM 细化为预测复杂生物反应的通用工具的早期迹象。