论文
LLM需要多少结构?评估 LLM 的文献计量聚类描述
How Much Structure Do LLMs Need? Evaluating LLMs for Bibliometric Cluster Description
摘要
大语言模型 (LLM) 可以支持科学文献综合,但仍然容易出现幻觉引用、覆盖不均匀和基础薄弱的主题组织。我们通过比较在不同证据和结构水平下生成簇描述的六个管道来评估文献计量结构是否改善了 LLM 辅助合成。使用 100 篇已发表的文献计量分析,我们重建了 Scopus 语料库,提取了人类编写的聚类描述,并通过人类对齐、语义覆盖、聚类质量、图形质量和参考基础来评估输出。结果表明,LLM 生成的描述在语义上与人类编写的描述接近,但当要求从头开始推断文献计量结构时,它不可靠。当文献计量算法定义聚类并且 LLM 解释它们时,性能会提高。总体而言,LLM 辅助的文献计量综合作为混合工作流程最有前途,其中算法提供可审核的结构,而 LLM 生成可读的描述。