论文
用大语言模型辅助发表后研究评价:专家意见与引用指标对照
Large language models for post-publication research evaluation: Evidence from expert recommendations and citation indicators
摘要
科学研究质量评价面临规模、主观性和时间延迟等限制。本文检查大语言模型能否依据论文文本辅助发表后同行评价,并与专家意见及引用指标比较。研究在H1 Connect论文中设置高质量文章识别,以及评分、优点分类和专家风格评论等细粒度任务,比较BERT、通用大模型和推理大模型及不同学习策略。识别高度推荐论文的准确率超过0.8,但细粒度评级表现明显下降。少样本提示优于零样本,监督微调取得最强且较均衡的表现。检索增强提示在部分情况下提高分类准确率,但不能稳定改善与引用指标的一致性。模型输出与引用指标总体呈正向但中等程度相关。