论文

GenCircuit-RL:基于分层验证的基因线路设计强化学习

GenCircuit-RL: Reinforcement Learning from Hierarchical Verification for Genetic Circuit Design

模型训练强化学习RLVR

摘要

尽管合成生物学已有数十年进展,基因线路设计仍然是一个费力且依赖专家的过程。我们通过代码生成来研究该问题:模型用pysbol3生成Python代码,以合成生物学开放语言(SBOL)构建基因线路——一种支持自动化验证的形式化表示。我们提出GenCircuit-RL,一个围绕分层验证奖励构建的强化学习框架,将正确性分解为从代码执行到任务特定拓扑检查的五个层级,并配以将优化压力从代码生成转向功能推理的四阶段课程。我们还推出SynBio-Reason,一个包含4753个线路的基准,覆盖六种经典线路类型和从代码修复到从头设计的九个任务,并预留生物学元件用于分布外评估。分层验证较二值奖励在功能推理任务上将任务成功率提升14至16个百分点,且课程学习对强劲的设计性能必不可少。所得模型能生成拓扑正确的线路、泛化到新颖的生物学元件,并重新发现合成生物学文献中的经典设计。

GenCircuit-RL:基于分层验证的基因线路设计强化学习:论文配图
图 1:GenCircuit-RL 系统概览。区域 1:我们从三个来源(程序生成、Cello 和文献)构建了 4,753 个电路,涵盖九个任务。区域 2:训练分两个阶段进行——SFT,然后是基于 GRPO 的 RLVF。四阶段课程将奖励重点从执行(第一阶段)、结构(第二阶段)和推理(第三阶段)转移到从头设计(第四阶段),并通过验证集任务成功率来控制晋升。区域 3:对保留的程序电路、具有新型抑制子-启动子对的分布外Cello电路以及Literature-91 规范电路的评估。