论文
EnvHarness:唤醒静态世界以赋能智能体学习
EnvHarness: Awakening Static Worlds for Agent Learning
摘要
LLM智能体通过与环境的交互来学习,但这些环境是手工构建且静态的:对智能体的弱点视而不见,并随着智能体的进步很快被甩在身后。尽管近期的环境生成方法试图解决这一问题,它们需要领域专用的流水线,依赖昂贵或不可靠的验证器,而且产出的环境仍是静态的。为减轻从零重建环境的工程负担,我们提出 Environment Harness(EnvHarness),一个由可插拔组件构成的可编程层,它包裹静态环境以重塑其行为,而无需修改底层逻辑。通过标准接口运作,EnvHarness 可应用于多种领域,同时确保每个被重塑的环境保留其原有验证器。为实现这一过程的自动化,我们引入 EnvRigger,它将目标策略视为黑盒,通过观察其执行轨迹来合成针对所诊断缺陷的 EnvHarness 组件,并通过新的 rollout 进行验证。在四个领域的五个基准上,EnvHarness 的表现优于原始环境和领域专用的环境生成流水线,在留出实例上取得最高 9.0 点的提升,同时执行步骤减少 9.8%。此外,EnvHarness 为强化学习提供了更优的优化信号,使策略与环境能够持续、有针对性地共同演化。
