论文
关于稳定的长格式生成:基准测试和减轻长度波动
On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility
摘要
大语言模型 (LLM) 擅长长上下文理解,但在长格式生成方面表现出明显的局限性。现有研究主要关注单代质量,通常忽视了产出的波动性。这种波动性不仅会导致巨大的计算成本,还会严重影响模型的可靠应用。为了解决这一差距,我们的工作分三个阶段展开:基准测试、探索和缓解。我们首先提出了长格式文本基准中的 VOlatility (VOLTBench),这是一种新颖的异构任务基准,旨在系统地量化长格式生成的长度波动性。随后,通过分析注意力轨迹,我们进行了深入的探究,以确定导致这种波动的几种常见的内部模式。最后,为了减轻长格式输出的波动性,我们提出通过 logits Boosting (GLoBo) 进行稳定生成,这是一种轻量级解码阶段优化策略,旨在显着提高长格式生成的长度准确性和稳定性,而无需额外训练。 VOLTBench 上的大量实验首次系统地证实了主流模型中严重的长式输出不稳定,并验证了我们提出的方法成功地将基础模型的平均输出长度提高了 148%,并将长度波动性降低了 69%,同时保持了较高的生成质量。