论文

OmniVCBench:针对 AI 虚拟细胞的循证多模态推理基准测试

OmniVCBench: Benchmarking Evidence-Grounded Multimodal Reasoning Towards AI Virtual Cells

模型评测基准与评测资源

摘要

人工智能虚拟细胞(AIVC)被设想为模拟细胞反应、解释潜在机制并支持假设驱动的发现的科学Agent。然而,现有的 AIVC 基准主要在模拟层运行,激发对模型如何解释实验证据和制定生物学假设的补充评估。我们推出了 OmniVCBench,这是一个以图形为中心、可追溯源的基准,用于 AIVC 的解释组件。它包含 6,077 个精选的单子图和多子图问答对,这些问答对源自科学文献中的图形和实验背景。在布鲁姆分类法的指导下,我们通过三个科学推理任务实例化 AIVC 预测-解释-发现议程的解释层对应项。我们进一步介绍了 AIVC-Judge,这是一个以任务为条件的 MLLM 作为评审框架,具有特定类别、参考感知的评分标准,用于评估开放式回答。互补的模型派生硬负挖掘 (MDHNM) 策略将模型推理过程中观察到的似是而非的错误转换为 MCQ 干扰因素,以实现更低成本的评估。在评估的异构模型池中,MCQ 准确度与 AIVC-Judge 分数呈正相关,与开放式响应评估一起提供了性能的补充视图。代码和数据演示可在 https://anonymous.4open.science/r/OmniVCBench. 获取