论文
LLM会话摘要的大规模多维实证研究
A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization
摘要
尽管 LLM 在对话摘要方面取得了显着进步,但其评估仍然受到场景、输入长度和样本大小不足的限制。此外,现有的基准测试往往忽略前沿推理系统和高效的小模型,或者缺乏细粒度、多维度的评估。为了弥补这些差距,我们提出了 OmniCSEval,这是一个统一的基准,包含六个现实场景中的 1,800 个不同对话,其上下文长度范围为 128 到 32k 词元。对于细粒度评估,我们采用双向事实检查框架,该框架集成了关键事实匹配来评估完整性和简洁性,并结合摘要事实验证来评估 忠实性。为了确保评估的可靠性,我们建立了一个用于关键事实提取的人类 LLM 协作管道和一个用于摘要事实分解的多 LLM 共识验证器。利用这个框架,我们评估了四个不同类别的 28 个 LLM,这些类别按推理能力和模型规模分组。我们广泛的实证研究揭示了有关当前 LLM 继续面临的跨场景挑战、推理和规模的影响以及推理模型的效率和适应性的重要见解。我们还为实际部署中的系统选择提供指导。