论文
面向学术工作流的LLM:对短与长上下文窗口下LLM生成文献综述的评估
LLMs for Academic Workflows: An Evaluation of Literature Reviews Generated with Short and Long Context Windows of LLMs
摘要
我们的研究聚焦于评估在大语言模型(LLM)短上下文和长上下文设置下生成的文献综述,以考察上下文窗口对AI生成文献综述质量的影响以及AI在支持文献综述写作中的作用。基于来自Semantic Scholar和Arxiv研究来源的20篇AI生成文献综述由两位研究者从15个维度进行评估。我们的发现表明,AI生成的文献综述需要人工监督才能达到学术出版标准。随着上下文窗口增大,LLM能够纳入更广泛的信息并在更长输入上保持连贯,但它们也加剧了内容重复、遗漏关键工作以及倾向于描述而非综合等问题。我们的工作表明,AI生成的综述可以提供基础性概览,但其输出必须经领域专家批判性评估与打磨。未来研究应考虑整合其他LLM和不同领域的微调模型,并采用将人类专长与AI能力相结合的混合方法,以应对本研究识别出的局限。