论文
面向观测天文推理任务的视觉语言模型系统性评估
A systematic evaluation of vision-language models for observational astronomical reasoning tasks
摘要
视觉语言模型(VLM)日益被提议用作科学数据解读的通用工具,但其在多模态真实天文观测上的可靠性尚未经过检验。我们提出 AstroVLBench,一个综合基准,包含超过 4,100 个经专家核验的实例,覆盖光学成像、射电干涉、多波段测光、时域光变曲线和光学光谱五类任务。通过评估六个前沿模型,我们发现性能强烈依赖于模态:虽然有一个模型(Gemini 3 Pro)在各任务上表现最为持续出色,但各模型的任务特定优势各异,且所有模型都明显不及领域专用方法。机制消融实验揭示,性能不仅取决于将注意力引向显著的视觉特征,还取决于将这些特征锚定于物理知识。描述“看什么”的现象学提示可以通过收窄模型焦点来提升准确率,但解释“这些特征为何重要”的物理提示整体表现更佳,并带来更均衡的分类结果、降低类别特定偏差。与这一图景一致的是,将底层的一维测量以数值表格而非渲染图的形式直接呈现,最多可带来 13 个百分点的提升。推理质量分析进一步表明,在缺乏显式物理知识关联时,模型可能凭借现象学上貌似合理的线索得出正确预测,却给出物理上不准确的理由,这证明仅有准确率不足以支撑可信的科学部署。这些发现为 VLM 在观测天文学中提供了首个系统性、多模态的基线,并指明了当前模型失效的具体表示、物理知识关联与推理瓶颈。
