论文

选择性观察下经结构化动作信用学习CLI智能体

Learning CLI Agents with Structured Action Credit under Selective Observation

模型训练强化学习Agentic RL

摘要

命令行界面 (CLI) 代理正在成为一种实用范例,用于通过不断发展的文件系统、可执行命令行程序和在线执行反馈进行代理与计算机交互。最近的工作使用强化学习 (RL) 从可验证的任务反馈中学习这些交互能力,但很少有方法利用 CLI 操作的本机结构化属性作为学习信号。除了这种未充分利用的动作结构之外,CLI 学习还给编码代理带来了两个瓶颈。首先,代理必须从部分观察中识别大型代码库中与任务相关的证据。其次,稀疏的终端奖励必须分配给形成长多回合轨迹的动作。我们通过 shell 驱动的信息提取和文件编辑任务来研究这些瓶颈。为了选择性观察,我们引入了 $σ$-Reveal,这是一种推理时间机制,可为同一 CLI 选择令牌预算上下文。对于贡献归因,我们提出了行动优势分配($\mathrm{A}^3$),这是一种原生代理强化学习方法,保留了标准代理强化学习的算法复杂性。 $\mathrm{A}^3$ 根据情节级相对反馈、基于抽象语法树(AST)的动作子链残差和树级轨迹裕度构建回合级优势。为了进一步评估这个问题设置,我们构建了 ShellOps,这是一个可验证的数据集套件,涵盖存储库环境中的 CLI 任务。

选择性观察下经结构化动作信用学习CLI智能体:论文配图
图 1:可验证 CLI 任务工作流程概述。 (a) ShellOps 任务实例,具有自然语言查询、初始工作区文件树、可验证的 gold bash 解决方案以及预期的执行后工作区或标准输出。 (b) ShellOps 和 ShellOps-Pro 覆盖文件扩展名和四个任务轴(查找、聚合、编辑、混合)。 (c) 具有工作空间观察、shell 操作生成、沙箱执行和基于模式的评分的统一可验证循环。