论文

Logos:用于合理分子设计的可进化推理引擎

Logos: An evolvable reasoning engine for rational molecular design

模型训练监督微调与指令调优

摘要

功能分子的发现与设计仍然是化学、生物学和材料科学领域的核心挑战。尽管机器学习的最新进展加速了分子性质预测与候选分子生成,现有模型往往要么在物理保真度上表现出色却缺乏透明推理,要么推理灵活却无法保证化学有效性。这种不平衡限制了人工智能系统在真实科学设计工作流中的可靠性。本文提出Logos,一个将多步逻辑推理与严格化学一致性相结合的紧凑分子推理模型。Logos采用分阶段训练策略:首先让模型接触将分子描述与结构决策关联起来的显式推理示例,然后逐步将这些推理模式与分子表示对齐。在最后一个训练阶段,化学规则与不变量被直接纳入优化目标,引导模型产生化学有效的输出。在多个基准数据集上,Logos在结构准确性与化学有效性两方面均取得强劲表现,以仅为其一小部分的参数量匹敌或超越大得多的通用语言模型。除基准评估外,该模型在涉及多个可能相互冲突约束的分子优化任务中表现出稳定的行为。通过显式展示中间推理步骤,Logos使人类能够检查并评估每个生成结构背后的设计逻辑。这些结果表明,对推理结构与物理一致性的联合优化,为分子科学领域可靠且可解释的AI系统提供了一条可行路径,支持人工智能更紧密地融入科学发现过程。

Logos:用于合理分子设计的可进化推理引擎:论文配图
图 1:Logos 的概念框架和训练流程。 a,Logos 将专业模型(右下)的化学准确性与一般LLM(左上)的推理相结合,解决了可解释性和结构有效性。 b,三阶段管道:周期1(自我数据蒸馏)使用教师模型构建思想链(CoT)数据;第 2 周期(监督微调)进行分子设计训练; Cycle 3(以分子为中心的 GRPO)使用带有化学奖励的强化学习。 c,ChEBI-20 和 PCdes 的有效性分数; Logos-1.5b(最终版)和 Logos-4b 接近 ∼\sim99.9%,优于较大的基线。 d、Logos通过三种范式实现交互式分子设计