论文

EnvHarness:唤醒静态世界以赋能智能体学习

EnvHarness: Awakening Static Worlds for Agent Learning

智能体系统模型训练强化学习Agent 环境交互Agentic RL

摘要

LLM智能体通过与环境的交互来学习,但这些环境是手工构建且静态的:对智能体的弱点视而不见,并随着智能体的进步很快被甩在身后。尽管近期的环境生成方法试图解决这一问题,它们需要领域专用的流水线,依赖昂贵或不可靠的验证器,而且产出的环境仍是静态的。为减轻从零重建环境的工程负担,我们提出 Environment Harness(EnvHarness),一个由可插拔组件构成的可编程层,它包裹静态环境以重塑其行为,而无需修改底层逻辑。通过标准接口运作,EnvHarness 可应用于多种领域,同时确保每个被重塑的环境保留其原有验证器。为实现这一过程的自动化,我们引入 EnvRigger,它将目标策略视为黑盒,通过观察其执行轨迹来合成针对所诊断缺陷的 EnvHarness 组件,并通过新的 rollout 进行验证。在四个领域的五个基准上,EnvHarness 的表现优于原始环境和领域专用的环境生成流水线,在留出实例上取得最高 9.0 点的提升,同时执行步骤减少 9.8%。此外,EnvHarness 为强化学习提供了更优的优化信号,使策略与环境能够持续、有针对性地共同演化。

EnvHarness:唤醒静态世界以赋能智能体学习:论文配图
图3:包裹标准环境接口的EnvHarness组件概览。底层基础环境(原生状态转移和原始任务验证器)保持完全冻结。从左到右:基础环境,随后是三个EnvHarness组件——Stage、Contract和Chain。高亮的箭头和标题指示被重写的接口方法,代码块展示每个包装器如何在不改动基础环境的情况下修改状态初始化、转移动力学或观测处理。