论文

通过训练让Agent自主读取长文和分派子任务

Trained Agentic Context Management

上下文与知识模型架构模型训练Transformer合成数据上下文工程

摘要

研究将长上下文处理设计为可学习的工具使用流程。模型可以按词元范围读取原文,也可以带着指定问题调用子Agent处理片段。各Agent只维护较小的当前上下文,原文留在外部环境。 作者用多种合成任务微调Qwen3.6-35B-A3B,比较不同文档长度下的检索、计数和汇总表现。在OOLONG-synth文档超过4万词元的设置下,论文报告使用8千词元工作窗口的微调模型达到与GPT-5.4百万词元上下文相近的成绩。RULER中不同任务表现存在差异,结果说明训练读取和分派策略是一条可行路径,而非对所有长文任务的统一性能保证。

图1中的RULER结果:按文档长度比较外部读取与完整输入方式。
Figure 1: Results on RULER and OOLONG-synth. Our finetune runs in our harness with an 8K token per-agent context limit. GPT-5.4 (medium reasoning) and base Qwen3.6-35B-A3B (thinking disabled) receive the full document with the prompt (see Section 4 and Appendix A for more details). Base Qwen and GPT-5.4 are served with 64K and 1M token context limits, respectively. The OOLONG random baseline follows Bertsch et al. (2025, §2.3) .