论文

CrystalXRD-Bench:跨多样晶体材料评估视觉语言模型的XRD峰指标化能力

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

模型评测基准与评测资源

摘要

从粉末XRD图谱中识别米勒指数(Miller index)需要现有多模态基准尚未测试的能力:模型必须从渲染的科学曲线中读出狭窄峰的位置,再将该观察与多步晶体学推理相衔接。我们提出CrystalXRD-Bench,一个由10个公开晶体学数据库构建、含250个样本的基准,任务只有一个:恢复XRD图谱中最高强度峰所对应的全部HKL。每个样本将渲染的XRD图像与源CIF文本及化学式配对,因此可以并排检视视觉提取错误与推理错误。我们评估了七个视觉语言模型。最佳Jaccard得分为0.5888(GPT-5.4),精确匹配率为37.6%,但七个模型中有六个仍低于Jaccard 0.50;该任务远未解决。错误模式呈现系统性差异:双峰情形尤其脆弱,偏重召回的模型靠过度预测HKL换取覆盖率,而提供CIF文本并不能弥合晶体学计算上的差距。除模型排名外,该基准还指出了当前VLM在定量科学图表上失败的具体条件。所有数据与评估代码将公开。

CrystalXRD-Bench:跨多样晶体材料评估视觉语言模型的XRD峰指标化能力:论文配图
图 1:CrystalXRD-Bench 的流程。从 10 个数据库的 CIF 晶体结构开始,我们使用 pymatgen 生成标准化 XRD 图案,构建 HKL 联合地面实况,并使用集合匹配指标和过度预测惩罚来评估模型输出。