论文

从历史到状态:LLM智能体的常量上下文技能学习

From History to State: Constant-Context Skill Learning for LLM Agents

智能体系统上下文与知识上下文工程Agent Harness

摘要

大语言模型(LLM)智能体日益用于操作浏览器、文件、代码与工具,个人助理成为自然部署目标。但个人智能体面临隐私-成本-能力的张力:云端模型能很好执行多步工作流却把敏感中间上下文暴露给外部API;本地模型保隐私但可靠性不足。两种 setting 还要为冗长技能提示与不断增长的历史反复付费。我们提出常量上下文技能学习:一个面向重复性智能体工作流的「上下文进权重」框架——可复用流程在轻量任务族模块中学习,推理只 condition 在当前观察与紧凑状态块上。确定性追踪器从任务进度渲染该状态块并提供对齐的子目标奖励,使每个模块可经步级SFT训练、经在线RL精化。跨ALFWorld、WebShop与SciWorld,我们的智能体在Qwen3-4B、Qwen3-8B与Llama-3.1-8B上均取得强劲表现。Qwen3-8B下SFT+RL在ALFWorld未见任务成功89.6%、WebShop 76.8%、SciWorld未见66.4%;与受控ReAct提示基线相比每回合提示token降2-7倍——表明程序性上下文可以从提示搬进权重。

从历史到状态:LLM智能体的常量上下文技能学习:论文配图
图1:上下文进权重的技能学习流水线:任务族模块训练+紧凑状态块推理。