论文

CatalyticMLLM:面向催化材料的图-文本多模态大语言模型

CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

应用与实践科学研究

摘要

催化材料的性质预测与逆向结构设计通常被建模为两个独立任务:前者从给定结构预测目标性质,后者根据期望性质生成候选结构。尽管解耦范式便于实施“生成—评估—筛选”工作流,但生成模型与性质预测模型在表示空间和训练目标上的不一致,容易引入数据分布偏移和评估器偏差,从而限制闭环优化的稳定性。在本工作中,我们提出CatalyticMLLM,一个面向催化材料的统一图-文本多模态大语言模型,它在同一模型和共享表示空间中整合了性质预测与逆向设计。在该统一框架下,CatalyticMLLM不仅能利用三维结构和文本信息进行可靠的性质预测,还能以目标性质为条件生成并筛选物理可行的CIF候选,从而形成“逆向设计—预测—筛选—再设计”的闭环优化工作流。实验结果表明,该统一范式在催化弛豫能预测和逆向设计任务上均优于解耦基线,验证了在单一多模态模型中联合建模性质预测与结构生成的有效性。

CatalyticMLLM:面向催化材料的图-文本多模态大语言模型
图 3:QE-Chem 框架的工作流程。 EquiformerV2 从具有周期性边界条件的 3D 原子结构中提取几何嵌入,而结构化文本则使用 CatBERTa 样式的三部分字符串表示形式进行编码。两个特征流首先通过对比学习在潜在空间中对齐,然后融合在多模态 LLM 主干中,并通过数值回归头和自回归头联合用于吸附能预测和结构生成。