论文
大语言模型能识别已发表研究的方法缺陷吗?
Can Large Language Models Detect Methodological Flaws? Evidence from Gesture Recognition for UAV-Based Rescue Operation Based on Deep Learning
摘要
机器学习研究中的数据泄漏会损害报告结果的可信度。本文以一篇在小规模人类手势数据上报告近乎完美准确率的论文为例,检查大语言模型能否独立识别方法缺陷。作者首先指出训练集与测试集划分不独立,评估协议符合受试者层面的泄漏特征。随后让六种大模型使用相同提示,在无先验说明的情况下独立分析原论文。模型均认为评估存在缺陷,将高性能归因于不独立的数据划分,并引用学习曲线重叠、泛化差距很小和近乎完美分类等迹象。该案例表明,大模型可根据公开论文辅助识别常见方法问题,但其一致意见并非确定性证明。