论文
MolViBench:评估 LLM 的分子振动编码
MolViBench: Evaluating LLMs on Molecular Vibe Coding
摘要
分子振动编码是化学家与 LLM 交互以生成分子任务的可执行程序的范例,它已成为具有预定义工具的化学试剂的灵活替代方案,使化学家能够表达任意复杂的定制工作流程。与一般编码任务不同,分子编码提出了一个独特的挑战,即 LLM 应该联合配备编程、分子理解和特定领域的推理能力。然而,现有的基准仍然脱节。 HumanEval 和 SWE-bench 等通用代码生成基准不需要化学知识,而 S^2-Bench 和 ChemCoTBench 等专注于化学的基准则评估知识回忆或属性预测,而不是可执行代码生成。为了弥补这一差距,我们推出了 MolViBench,这是第一个为分子振动编码量身定制的基准测试。 MolViBench 包含跨越 5 个认知级别的 358 个策划任务,从单一 API 召回到端到端虚拟筛选流程设计,涵盖 12 个现实世界的药物发现工作流程。为了严格评估生成的代码,我们还提出了一个多层评估框架,该框架结合了类型感知输出比较和基于 AST 的 API 语义回退分析,共同衡量可执行性和化学正确性。我们系统地评估了 9 个前沿编码 LLM 并比较了三种现实世界的分子振动编码范式,为诊断 LLM 在人工智能加速分子发现中的编码能力提供了实用且细粒度的测试平台。