论文
选择性观察下经结构化动作信用学习CLI智能体
Learning CLI Agents with Structured Action Credit under Selective Observation
摘要
命令行界面 (CLI) 代理正在成为一种实用范例,用于通过不断发展的文件系统、可执行命令行程序和在线执行反馈进行代理与计算机交互。最近的工作使用强化学习 (RL) 从可验证的任务反馈中学习这些交互能力,但很少有方法利用 CLI 操作的本机结构化属性作为学习信号。除了这种未充分利用的动作结构之外,CLI 学习还给编码代理带来了两个瓶颈。首先,代理必须从部分观察中识别大型代码库中与任务相关的证据。其次,稀疏的终端奖励必须分配给形成长多回合轨迹的动作。我们通过 shell 驱动的信息提取和文件编辑任务来研究这些瓶颈。为了选择性观察,我们引入了 $σ$-Reveal,这是一种推理时间机制,可为同一 CLI 选择令牌预算上下文。对于贡献归因,我们提出了行动优势分配($\mathrm{A}^3$),这是一种原生代理强化学习方法,保留了标准代理强化学习的算法复杂性。 $\mathrm{A}^3$ 根据情节级相对反馈、基于抽象语法树(AST)的动作子链残差和树级轨迹裕度构建回合级优势。为了进一步评估这个问题设置,我们构建了 ShellOps,这是一个可验证的数据集套件,涵盖存储库环境中的 CLI 任务。
