论文

长上下文自引导测试时训练 LLM

Self-Guided Test-Time Training for Long-Context LLMs

模型训练监督微调与指令调优

摘要

长上下文处理对于 大语言模型 (LLM) 来说变得越来越重要,但简单地扩展上下文窗口并不能保证长输入的有效利用。随着输入长度的增加,准确性通常会下降,这表明模型仍然难以识别和使用与问题最相关的证据。提高长上下文利用率的一种有前途的方法是测试时训练(TTT),它将测试上下文视为特定于实例的参数适应的训练示例。然而,将 TTT 应用于整个长上下文的成本过高,而适应随机采样的跨度会引入严重的噪声。由于长上下文中的大多数跨度与特定问题无关,因此对它们进行训练甚至可能会降低基本模型的性能。我们的初步研究表明,TTT 对训练跨度质量高度敏感:在 LongBench-v2 上,随机采样跨度上的 TTT 会损害性能,而预言机跨度上的 TTT 会显着提高性能。受此启发,我们提出了一种简单的方法,即自引导 TTT (S-TTT):在适应之前,模型会识别应学习的证据范围,并且标准语言建模训练目标仅应用于那些选定的范围。在两个具有挑战性的长上下文推理基准测试(LongBench-v2 和 LongBench-Pro)上,S-TTT 提高了 Qwen3-4B-Thinking-2507 和 Llama-3.1-8B-Instruct 的准确性,实现了高达 15% 的相对改进。