论文
SPM-Bench:面向扫描探针显微术的大语言模型基准
SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy
摘要
随着 LLM 在通用推理上取得突破,其在专业科学领域的熟练程度暴露出现有基准的明显缺口,原因包括数据污染、复杂度不足与高昂的人力成本。我们提出 SPM-Bench,一个原创的、博士级多模态基准,专为扫描探针显微术(SPM)设计。我们提出全自动数据合成流水线,同时保证高权威性与低成本。通过采用 Anchor-Gated Sieve(AGS)技术,我们高效地从 2023 至 2025 年发表的 arXiv 与期刊论文中提取高价值图文对。通过混合云-本地架构——VLM 仅返回空间坐标“llbox”供本地高保真裁剪——我们的流水线在保持高数据纯度的同时实现极致 token 节省。为准确客观地评估 LLM 表现,我们提出 Strict Imperfection Penalty F1(SIP-F1)分数。该指标不仅建立了严格的能力层级,还首次量化模型“个性”(保守型、激进型、赌徒型或智者型)。通过将这些结果与模型自报置信度和感知难度关联,我们揭示了当前 AI 在复杂物理场景中的真实推理边界。这些洞见确立 SPM-Bench 为可泛化的自动化科学数据合成范式。
