论文

ECHO:终端代理免费学习世界模型

ECHO: Terminal Agents Learn World Models for Free

模型训练强化学习

摘要

CLI 代理是语言模型最接近具体设置的东西:模型发出命令,终端执行命令,返回的流(stdout、错误、文件、日志和跟踪)记录结果。我们认为这个流是一个监督信号,但标准代理 RL 丢弃了它:GRPO 风格的训练用稀疏的结果级别奖励更新动作词元,同时忽略已经在采样轨迹中的环境响应。尽管包含有关环境如何响应的丰富证据,但失败的采样轨迹几乎没有提供政策梯度信号。我们引入了 ECHO(环境交叉熵混合目标),这是一种混合目标,它将动作标记上的标准策略梯度损失与辅助损失相结合,辅助损失训练策略来预测其自身动作产生的环境观察标记。 ECHO 重复使用与 GRPO 相同的前向传递,不需要额外的 rollout,并将终端反馈转化为对所有 rollout 的密集监督。 ECHO 在 TerminalBench-2.0 上将 GRPO pass@1 提高了一倍:Qwen3-8B 从 2.70% 提高到 5.17%,Qwen3-14B 从 5.17% 提高到 10.79%。 ECHO 还制定了更好地预测终端动态的策略,即使是在它们没有生成的轨迹上:在持续采样轨迹的过程中,它急剧降低了环境词元交叉熵,而 GRPO 本身几乎无法改变它。从基础 Qwen3-8B 开始,ECHO 在没有专家演示的情况下在保留终端任务上匹配专家 SFT 和 GRPO 性能,并在 TerminalBench-2.0 上恢复大约一半的专家 SFT 初始化优势。在某些设置中,仅环境预测损失就可以实现无需验证者的自我改进,从而允许策略仅通过从环境交互中学习来改进未见的 OOD 任务。总之,这些结果表明,环境观测不仅是未来行动的背景,而且是每次部署中都已存在的密集 同策略 监督信号。