论文

总结尚未消亡

Summarization is Not Dead Yet

模型评测评测方法与指标

摘要

大语言模型 (LLM) 的进展引发了关于模型生成的摘要可以与人类编写的参考文献相媲美甚至超越的说法,引发了关于摘要是否仍然是一个开放研究问题的疑问。我们通过涵盖不同数据集和最先进的 LLM 的多轨评估重新审视这一叙述,结合受控的人类评估、减轻偏见的 LLM-as-Judge 协议、针对外部知识的事实性验证以及语料库级语言分析。我们的研究结果揭示了一个更微妙的景观,其中人类参考继续表现出信息量和 忠实性 方面的优势,而 LLM 输出主要是因为表面层的连贯性和流畅性而受到青睐。事实验证表明,人类参考仍然更加可靠,特别是对于涉及推理或综合的主张,并且语言分析揭示了不同模型之间的风格同质性模式。这些观察结果表明,当前的 LLM 已经提高了摘要质量的下限,但其性能的上限仍然低于人类的能力。