论文

物理基础模型可以学习广义物理吗?跨物理制度和分配变化的偏见意识基准

Do Physics Foundation Models Learn Generalizable Physics? A Bias-Aware Benchmark Across Physical Regimes and Distribution Shifts

模型评测基准与评测资源

摘要

最近的物理基础模型声称具有一般的时空预测能力,但它们的评估经常将性能压缩为固定训练分布下的单个平均分数。这使得很难确定模型是否已经学习了可概括的物理动力学或仅在特定设置下表现良好。我们构建了一个基准,包含 8 个物理动力学、3 个训练数据混合和 25 个由动态尺度和初始条件复杂性变化引起的测试方案,涵盖分布内、分布转移和分布外设置。我们评估了五种物理基础模型架构和每种架构的四种模型变体(临时和三种预训练大小),产生了 60,000 次测量。我们的结果表明,当前的物理基础模型表现为有条件的而不是通用的通才:它们的通用性取决于物理机制、时间尺度、初始条件设置、预训练、模型大小和架构。改进训练数据分布只能部分缓解这一限制。预训练和扩展也无法可靠地消除他们的能力偏差。我们认为,改进物理基础模型需要超越缩放模型或扩展数据,转向能够更好地捕获跨制度、时间尺度和分布变化的可转移物理知识的学习机制。