论文

ACC:编译代理轨迹以进行长上下文训练

ACC: Compiling Agent Trajectories for Long-Context Training

模型训练合成数据

摘要

最近智能体的发展对LLM的长上下文推理能力产生了新的需求。然而,训练 LLM 的这种能力需要昂贵的长文档管理或启发式上下文合成。我们观察到,智能体在解决问题、调用工具以及在多个回合中接收环境观察结果时会产生大量的轨迹。因此,回答原始问题所需的证据分散在这些转弯中,需要整合遥远的上下文片段。然而,标准代理 SFT 掩盖了工具响应,并且仅训练回合级工具选择,从而创建了一个监督盲点,使这些分散的信号未被使用。我们提出了代理上下文编译(ACC),它将搜索、软件工程和数据库查询代理的轨迹转换为长上下文问答对,将原始问题与多轮收集的工具响应和环境观察相结合,训练模型直接回答而无需使用工具。这使得问题和证据之间的依赖关系变得明确,从而能够直接监督远距离片段的长上下文推理,而无需额外注释。 ACC 是一种简单但有效的方法,可以与任何现有的长上下文扩展或训练方法相结合,提供可扩展的监督 微调 数据。我们通过 MRCR 和 GraphWalks 在远程依赖建模任务上验证 ACC,挑战需要跨轮共指解析和扩展上下文上的图遍历的基准。使用 ACC 训练 Qwen3-30B-A3B 在 MRCR 上达到 68.3 (+18.1),在 GraphWalks 上达到 77.5 (+7.6),结果与 Qwen3-235B-A22B 相当,同时保留 GPQA、MMLU-Pro、AIME 和 IFEval 的一般能力。进一步的机制分析表明,ACC 训练的模型表现出任务自适应注意力重组和专家专业化。