论文

大语言模型 生物分子建模的局限性:跨尺度评估

The limits of bio-molecular modeling with large language models : a cross-scale evaluation

模型评测基准与评测资源

摘要

跨分子尺度的生物分子系统建模仍然是科学研究的核心挑战。 大语言模型 (LLM) 越来越多地应用于生物分子发现,但跨多尺度生物问题的系统评估以及对其工具增强功能的严格评估仍然有限。我们通过提出的跨尺度生物分子基准揭示了 LLM 性能和机制理解之间的系统差距:BioMol-LLM-Bench,这是一个统一框架,包含 26 个下游任务,涵盖 4 个不同的难度级别,并且集成了计算工具以进行更全面的评估。对 13 个代表性模型的评估揭示了 4 个主要发现: 思想链数据提供的益处有限,甚至可能降低生物任务的性能;混合曼巴注意力架构对于长生物分子序列更有效;有监督的 微调 以泛化为代价提高了专业化;目前的 LLM 在分类任务上表现良好,但在具有挑战性的回归任务上仍然较弱。总之,这些发现为未来基于 LLM 的分子系统建模提供了实用指导。