论文

像科学家一样思考? LLM 生成的研究方法的结构研究

Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地用于指导研究方法,但它们在最小提示下的默认方法论倾向仍不清楚。在这里,我们使用从最近 1,000 篇 arXiv 计算机科学论文中提取的 LLM 研究问题来提示 GPT-5.1、Gemini 3 Pro 和 DeepSeek-V3.2,并将所得的方法建议与论文衍生的实验清单进行比较。由于我们只提供研究问题,因此我们衡量的差异反映了最初的建议,而不是这些建议的最佳程度。我们从两个来源中提取结构化方法特征,将它们映射到共享分类法中,并量化多个分类法维度(包括模型提供者、数据集任务类型和评估指标类型)之间的差异。最严重的不平衡出现在提供商的选择上,Jensen-Shannon 分歧比任何其他分类维度大 3-5 倍左右。其他/学术单一出现模型的代表性不足 23-24 个百分点,而重用的学术/社区模型的代表性则稍高(4-6 个百分点)。 LLM 还提出总体上范围更窄的方法:模型实体合约的有效数量从 1,232 到 59-96,并且 LLM 之间的排名相关性 (0.55-0.68) 通常超过 LLM 与纸张的相关性 (0.33-0.56),因此失真在很大程度上是跨模型共享的。流行度基线、BM25 检索校准和论文级相似性测试确认输出是特定于查询的响应,但通过更窄的选项集进行过滤。因此,在没有交叉检查的情况下依赖 LLM 建议的研究人员可能会缩小其方法搜索空间,走向更集中的默认值。