论文

随机 YaRN 改进了长上下文推理的长度泛化

Randomized YaRN Improves Length Generalization for Long-Context Reasoning

模型架构Transformer

摘要

大语言模型 (LLM) 通常在短序列上进行预训练,然后通过额外训练扩展到更长的序列。然而,这样的 LLM 仍然难以进一步推广到非常长的序列。我们提出了随机 YaRN,这是一种通过将基于 YaRN 的位置外推与随机位置编码和长度课程相结合来提高长度泛化的训练方法。在短上下文数据的训练过程中,标记被分配从更大位置范围采样的 YaRN 位置编码,即使在短上下文输入上,模型也会暴露于分布外的位置表示。我们在三个具有挑战性的长上下文推理基准测试(BABILong、多轮共指解析(MRCR)和 LongBench v2)上评估随机 YaRN。在使用短上下文进行数据训练时,随机 YaRN 持续提高了上下文长度(从 16K 到 128K)的推理性能,并且优于标准 微调,最大的增益出现在远远超出分布的长度处。我们的结果表明,逐步将模型暴露于 OOD 位置分布为可推广的长上下文推理提供了有效的方法。