论文
LLM 仅通过阅读综合和处理散文就能预测高分子物理吗?
Can LLMs Predict Polymer Physics Just by Reading Synthesis and Processing Prose?
摘要
大语言模型 能否仅通过阅读非结构化科学散文来预测聚合物的物理和机械性能?聚合物性能很少仅由化学结构决定;相同的标称聚合物可能表现出截然不同的行为,具体取决于其合成路线、加工历史、形态和测试条件。然而,最先进的聚合物特性模型通常依赖于仅结构的表示(例如 SMILES 或分子图),这剥夺了这种重要的实验背景。在这项工作中,我们引入了 \textbf{PolyLM},这是一种纯自然语言、过程和条件感知的框架,可以直接从全文文献中预测材料性能。通过完全规避结构输入,PolyLM 保留了领域科学家报告的合成和处理的细致入微的非结构化描述。为了训练这个框架,我们策划了一个前所未有的文献规模数据集,其中包含 185,000 篇科学论文和超过 276,400 个独特的聚合物样本,涉及 22 个物理、机械和热性能。我们使用低秩适应 (LoRA) 和任务级不确定性加权对一个包含 90 亿参数的大规模语言模型 (Qwen3.5-9B) 进行了微调。该模型根据 68,283 个保留的观测值进行评估,实现了非常高的预测精度,为复杂属性建立了新的最先进基准。在 22 个不同的目标中,该模型的 $R^2$ 中位数为 0.74,对关键热、机械和物理化学特性的预测经常超过 0.80 的 $R^2$。这些结果明确表明,自然语言是一种强大的、高度可扩展的界面,可用于实际材料性能预测。