论文

AI辅助物理学、天体物理学和宇宙学科学研究的能力二:项目规划和提案评估

AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology II: Project Planning and Proposal Evaluation

模型评测模型能力评测

摘要

我们研究了 大语言模型 (LLM) 如何更好地协助科学项目规划和提案评估。由人类研究人员和三个当代 LLM(ChatGPT、Claude 和 DeepSeek;2025 年中期模型,使用其默认工具访问权限)为物理学、天体物理学和宇宙学领域的 8 个专家构思的研究项目独立生成一页项目计划。由此产生的 32 项提案由四位人类评审员和两个较新的前沿 LLM(Claude Opus 4.8 和 ChatGPT Pro 5.5)使用四方面评估标准进行盲评估。评审员还被要求确定每个提案是由人类还是人工智能编写的。人类评审员对人类和人工智能编写的提案的总体评分相似,而两位人工智能评审员对人工智能编写的提案的评分都比人类编写的提案高出约一分(五分制)。人类审阅者正确识别人类和人工智能编写的提案的概率分别为 72% 和 79%,而两位人工智能审阅者正确分类了所有 32 个提案 (100%)。这些结果表明,当前的 LLM 可以生成在人类审阅者眼中与人类编写的项目计划相当的项目计划,但人工智能审阅者对人工智能生成的提案表现出系统性偏好。我们的结果表明,在提案准备和评估中广泛部署 LLM 时要谨慎。