论文
FREA:反应可行性的多源专家基准验证
FREA: A Multi-Source Expert Benchmark for Reaction Feasibility Verification
摘要
由于生成模型和 AI 智能体提出的化学反应规模超出了专家评审的范围,可行性验证人员决定哪些提案进入合成计划。但他们的决定是否与不同类型候选人的化学家一致?我们介绍了 FREA,这是由化学专家在明确的可行性标准下标记的 751 个反应的基准,取自逆合成模型提案、零产量实验记录、大语言模型 (LLM) 的编辑和五种阴性候选生成方法。我们的评估发现,没有验证者能够跨越所有来源:仅给出标准的LLM与专用验证者具有竞争力,而前向模型在逆合成建议上表现最佳,但拒绝在评估的操作点对记录反应进行最可行的编辑。除了总分之外,在将不可行的替代断开与可行的生成候选分开时,两个前向模型的表现均低于随机水平。为了研究负面监督是否解决了这些弱点,我们还发布了包含超过 1400 万条记录反应的语料库,并生成了负面候选。在匹配的训练比较中,将生成的负数混合添加到转发训练会提高跨源的平均 AUROC,但这些收益不会扩展到逆合成提案。改变生成方法进一步表明,生成的候选者的最大增益与更差的提案筛选一致。这些发现促使我们根据不同来源的专家来评估验证者,并设计否定模型以转移到模型提案中。