论文
SC-Arena:一个通过知识增强评估进行单细胞推理的自然语言基准
SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation
摘要
大语言模型(LLM)在科学研究中的应用日益增多,为知识发现与推理提供了新能力。然而在单细胞生物学中,对通用与专用LLM的评估实践仍然不足:现有基准分散于不同任务之间,采用与真实使用方式相悖的多项选择分类等格式,且依赖缺乏可解释性与生物学依据的指标。我们提出SC-ARENA,一个为单细胞基础模型量身打造的自然语言评估框架。SC-ARENA形式化了一个虚拟细胞抽象,通过表征内在属性与基因级相互作用来统一评估目标。在这一范式下,我们定义了五个自然语言任务(细胞类型注释、描述生成、细胞生成、扰动预测和科学问答),用以探测细胞生物学的核心推理能力。为克服脆弱的字符串匹配指标的局限,我们引入知识增强评估,它整合外部本体、标记数据库与科学文献,以支持生物学上忠实且可解释的判断。在通用与领域专用LLM上的实验与分析表明:(i)在虚拟细胞统一评估范式下,当前模型在生物学复杂任务上表现参差不齐,尤其是那些需要机制性或因果性理解的任务;(ii)我们的知识增强评估框架确保生物学正确性,提供可解释、有证据支撑的理由,并具备高判别力,克服了传统指标的脆弱性与不透明性。SC-Arena由此为评估单细胞生物学中的LLM提供了一个统一且可解释的框架,为开发与生物学对齐、可泛化的基础模型指明方向。
