论文

LOHA与ACD:保留动作文本、压缩旧工具观察

Compress What You See, Not What You Say: Anchored Context Distillation for Latent-Observation Software Engineering Agents

上下文与知识模型训练强化学习上下文工程Agentic RL

摘要

工具观察主导了软件工程代理的环境,使得长期交互历史的维护成本高昂。现有的上下文压缩方法可能会丢弃后续操作所需的信息,而使代理适应软词元表示可能会损害其原始行为。为了减少上下文,同时保留关键操作信息和代理行为,我们将潜在观察、硬操作 (LOHA)(一种将压缩历史记录与精确参考所需的文本分开的上下文布局)与锚定上下文蒸馏 (ACD)(一种在限制行为漂移的同时实现潜在阅读的训练方法)相结合。 LOHA 将较旧的工具观察结果压缩为软词元,同时保留代理自己的回合和文本中的最后 K 个观察结果,从而提供对历史信息的紧凑访问和对最近内容的精确访问。为了使代理能够使用此表示,ACD 将基本模型的全文预测提取到潜在视图中,同时将其行为锚定到同一基本模型的纯文本输入上。在 SWE-bench Verified 上,K=3 使 Qwen3-4B 的每次调用上下文减少了 43%,SWE-Master-4B-RL 的每次调用上下文减少了 57%,问题解决率分别为 12.1% 和 21.8%,而未压缩基础模型的问题解决率为 14.5% 和 27.5%。在 K=8 时,单次运行新近度扫描达到 14.4% 和 23.0%,较大的窗口通常有利于任务性能而不是压缩。在 32K 词元限制下,K=3 的 Qwen3 在199个实例子集中解决了 21.1%,而使用全文的相同适配代理则为 11.1%。在并发单 GPU 服务中,它实现了全文代理实例吞吐量的 1.9 倍。

LOHA保留近期文本并压缩旧观察,ACD通过全文行为锚定训练潜在表示读取。
图1(图注摘要):LOHA保留近期文本并压缩旧观察,ACD通过全文行为锚定训练潜在表示读取。