论文
持续的驾驭:自我完善的基础特工的在线适应
Continual Harness: Online Adaptation for Self-Improving Foundation Agents
摘要
Claude Code 和 OpenHands 等编码工具将基础模型与工具、内存和规划包装在一起,但对于具体代理的长期部分可观察性决策,不存在等效项。我们首先报告我们的 Gemini Plays Pokemon (GPP) 实验。通过人机交互的迭代改进,GPP 成为第一个在困难模式下完成《精灵宝可梦 Blue》、《Yellow Legacy》和《Crystal》的 AI 系统,并且没有失败。在最困难的阶段,智能体本身开始通过长上下文记忆迭代其策略,在人机循环的完善过程中呈现出新兴的自我完善信号。持续性Harness将人类完全从这个循环中移除:一种用于实体代理的免重置自我改进Harness,可以将我们观察到的内容形式化和自动化。仅从最小的环境界面开始,代理在执行和完善自己的提示、子代理、技能和记忆之间交替,利用任何过去的轨迹数据。即时优化方法需要情节重置;连续Harness可在一次运行中在线适应。在 Pokemon Red 和 Emerald 跨前沿模型上,从头开始的持续Harness相对于极简基线大大降低了按钮按下成本,并弥补了与手工设计的专家Harness的大部分差距,尽管从相同的原始界面开始,没有策划的知识,没有手工制作的工具,也没有领域脚手架,但具有依赖于能力的收益。然后,我们用模型本身来闭合循环:一个在线过程奖励共同学习循环,其中开源代理通过改进中的 Harness 执行轨迹由前沿教师重新标记并用于更新模型,推动 Pokemon Red 游戏中持续的里程碑进展,而无需在训练迭代之间重置环境。