论文
重审零样本摘要:LLM摘要器可信度的实证考察
Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers
摘要
使用大语言模型(LLM)的零样本摘要以连贯流畅的摘要显著推进了抽象式摘要任务。但大语言模型底层的随机性引发对LLM生成摘要稳定性与可信度的担忧。由于LLM生成摘要在教育场景的扩散——学生与研究者以零样本方式总结复杂学术材料——该问题日益重要。我们提出一个新颖的两级诊断协议,基于生成摘要的稳定性为LLM摘要器建立基准:在较低层级,对受控环境下生成的多个LLM摘要做文档级稳定性分析并计算稳定系数;每个生成摘要就与原文档的语义与事实对齐打分,从而沿多于一个维度估计稳定性。在下一层级,把从语料分层抽样的文档观测汇总,估计LLM摘要器的稳定性指数——作为其可信度的代理。我们对三个LLM摘要器、三类文档体裁的实证考察显示:跨摘要评估指标,LLM间的生成级变异性存在统计显著差异。本研究以实证确认LLM摘要中的稳定性问题,推动面向鲁棒、可靠、可信LLM摘要器的进一步研究。
