论文

工作区优化:如何训练你的智能体

Workspace Optimization: How to Train Your Agent

智能体系统Agent Harness

摘要

基于前沿语言模型构建的现代智能体通常无法调整自身权重。那么,还有什么是可训练的?我们认为是智能体的工作区(workspace),即它读取、写入和测试的结构化外部基底;我们将其演化称为工作区优化。工作区优化针对的是那些前沿模型具有强先验但无法一次性解决任务的高难度多轮环境,因此智能体必须通过交互来学习。我们提出一种有原则的工作区演化方法,其结构与权重空间训练相呼应:以工件(artifact)替代参数,以证据替代数据,以反例替代损失,以文本反馈替代梯度。我们在DreamTeam中实例化这一思想,这是一个面向ARC-AGI-3的多智能体框架,其角色负责构建可执行的世界模型、规划、提出假设、探测、制定策略以及分派失败。在当前25个游戏的ARC-AGI-3公开集上,按官方评分协议并在两次独立运行上取平均,DreamTeam将与协议匹配的SOTA智能体得分从36%提升至38.4%,同时每局游戏使用的环境动作减少31%。

工作区优化:如何训练你的智能体:论文配图
(a) (b) 图 1:(a) 每场比赛 RHAE 差距 Δg=RHAEDreamTeam​(g)−RHAE human​(g)\Delta_{g}=\mathrm{RHAE}_{\textsc{DreamTeam}}(g)-\mathrm{RHAE}_{\mathrm{ human}}(g),在 DreamTeam 的两次独立运行中取平均值,人类得分采样于梦之队的行动预算;粗体的比赛标签标志着同等水平的完成者。 (b) DreamTeam 工作空间优化循环:回顾历史证据会产生更新的工作空间(假设、策略、日志),角色可以在下一步中读取该工作空间以完善其决策。