论文

面向生物扰动预测的渐进式多智能体推理

Progressive Multi-Agent Reasoning for Biological Perturbation Prediction

智能体系统Agent 协作

摘要

预测基因调控对生物扰动的响应需要就潜在的生物因果关系进行推理。尽管大语言模型(LLM)在此类任务上展现出潜力,但它们常常被高维扰动结果相互纠缠的特性所压倒。此外,近期工作主要聚焦于单细胞实验中的基因扰动,而对药物发现至关重要的批量细胞化学扰动在很大程度上仍未被探索。受此启发,我们提出LINCSQA,一个用于预测批量细胞环境下复杂化学扰动中靶基因调控的新基准。我们进一步提出PBio-Agent,一个将难度感知的任务排序与迭代式知识精炼相结合的多智能体框架。我们的关键洞见是,受同一扰动影响的基因共享因果结构,使得被高置信度预测的基因能够为更具挑战性的情形提供背景。该框架采用经生物知识图谱增强的专用智能体,由综合智能体整合输出,并由专用评判者保证逻辑连贯。PBio-Agent在LINCSQA与PerturbQA上均超越现有基线,使较小的模型也能在无需额外训练的情况下预测并解释复杂的生物过程。

面向生物扰动预测的渐进式多智能体推理
图1:LincsQA 基准构建流程概览。(i) 质量控制:筛选 LINCS L1000 Level 5 特征签名,以获得高质量的化合物处理。(ii) (b) 层级选择:采用两层策略将化合物与细胞系进行分层配对。Tier 1(临床共识)要求严格的临床适应症对齐,即化合物的获批治疗用途必须与细胞系的疾病来源相匹配。Tier 2(机制共识)适用于不存在临床匹配细胞系的情形,此时依据与化合物机制相关的靶点生物学和通路活性进行选择,而不依赖临床适应症。(iii) 共识特征签名:通过强制方向一致性(≥ 0.7)并计算按重复加权的共识 z 分数(z_g)来提取稳健信号。(iv) 基因选择:按 z 分数大小及 MoA 合理性对基因进行排序与过滤,形成二元查询。(v) 输出:最终基准由特定细胞-化合物上下文与高置信度的上调和下调基因集配对组成。