论文
DrugTargetWorld:用于训练与评测AI科学家的合成生物样本库
DrugTargetWorld: A Synthetic Biobank for Training and Benchmarking AI Scientists
摘要
药物靶点发现需要区分导致疾病的分子和仅与之相关的分子。训练和评估人工智能Agent以端到端执行此工作流程非常困难,因为现实世界的生物样本库缺乏已知的因果基础事实,并且参与者级数据受到访问控制。我们引入了 DrugTargetWorld,这是一个框架,可以按程序生成模拟生物库或“世界”,具有已知但隐藏的因果结构。每个世界都包含 54,000 名参与者的基因型、蛋白质、健康记录、结果和合成磁共振成像 (MRI)。Agent必须构建疾病表型,识别因果驱动蛋白,推断有益的调节方向,并可选择进行虚拟“湿实验室”实验。我们在 20 个心血管领域和 3 个实验预算的 540 个案例中评估了 9 种药物。 Opus 5 和 GPT-5.6 Sol 获得了最高的平均综合得分,分别为 39.98 和 35.38(满分 100),并且平均恢复了 64% 的因果驱动因素。然而,没有药物能够可靠地区分误导性的非因果蛋白质,并且性能仍然受到连接表型构建、因果证据和干预决策所需的综合判断的限制。通过让评估者了解每个世界的因果结构,但对Agent隐藏,DrugTargetWorld 将端到端药物靶点发现转变为可扩展的训练和评估问题,并具有可验证的奖励。