论文
基于序列的组学任务中 LLM 域适应的工具增强策略蒸馏
Tool-Augmented On-Policy Distillation for LLM Domain Adaptation in Sequence-Based Omics Tasks
摘要
多组学序列包含复杂的生物模式,但破译其自动化科学发现机制仍然具有挑战性。由于大型语言模型 (LLM) 解释这些序列,因此评估预测和科学推理至关重要。然而,多组学序列任务的现有基准依赖于分类和回归指标,忽略了模型是否掌握了潜在的生物学证据。我们推出了 OmicsBench,这是第一个多组学序列推理基准,包含 1,160 个经过专家验证的问题,涵盖 DNA 调控、RNA 加工和蛋白质功能等六项任务。 OmicsBench 需要可追踪的证据链,并使用与领域专家开发的特定于实例的规则进行评估。对 17 个大语言模型的评估揭示了一种反比关系:虽然科学大语言模型在序列分类准确性方面优于通用大语言模型,但它们未能提供有效的证据来支持其预测。一种看似合理的解释是捷径学习:专门的模型可能依赖于统计模式,而不是科学发现所需的生物机制。受这一发现的启发,我们引入了工具增强的策略蒸馏(TA-OPD),这是一种将序列预测与基于证据的生物推理相结合的训练后方法。在涵盖 0.8B 至 27B 参数的五个 Qwen3.5 模型中,TA-OPD 始终如一地加强生物证据基础,同时提高大多数任务的预测性能。这些收益在整个模型规模中持续存在,表明更强的序列推理不仅仅来自于模型容量的增加,而是可以通过证据感知训练来改进。 OmicsBench 和 TA-OPD 共同提供了一个用于诊断多组学大语言模型推理失败的框架,以及一条通往模型的道路,其预测更好地基于具有生物学意义的证据。