论文

TrajLong:联合设计Agentic和中期训练的长上下文监督

TrajLong: Co-Designing Agentic and Long-Context Supervision for Mid-Training

模型训练预训练

摘要

用于编码、搜索和工作任务的LLM智能体越来越依赖长上下文功能来有效聚合和推理扩展的交互历史记录。最近的工作将智能体轨迹纳入训练中期阶段,利用其自然长且相互作用丰富的结构。然而,如何将这些轨迹中的信息组织成有效的中期训练监督仍有待探索。在这项工作中,我们研究了长上下文和智能体原子能力之间的关系,并引入了 TrajLong,这是一种新颖的框架,它将轨迹编译为具有密集监督的长上下文训练任务,针对三种代表性的原子能力:证据支持、交叉证据聚合和时间状态维护。我们使用 TrajLong 编译的数据对 Qwen3-14B-Base 和 Qwen3-30B-A3B-Base 进行中期训练,然后进行监督微调。在 6 个长上下文和 12 个智能体基准测试上进行的实验显示出广泛的性能提升,受控的消融显示出相对于原始轨迹基线和屏蔽轨迹基线的改进。能力级分析进一步揭示了长上下文和智能体原子能力之间依赖于任务的关联。这些发现表明,长上下文推理和智能体执行的共享能力需求为设计中训练数据以开发下游智能体能力提供了原则基础。

TrajLong:联合设计Agentic和中期训练的长上下文监督的原论文方法或结果图
图 1:TrajLong 概述。左:全轨迹和屏蔽中训练策略与 TrajLong 编译的比较。右:Qwen3-14B 变体在搜索、工具使用和编码任务的七个长上下文和智能体基准上的 Avg@3 分数。