论文

超越静态评估:为可扩展智能体强化学习构建仿真环境

Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

随着大语言模型(LLM)演化为自主智能体,传统静态评估无法捕捉多步决策。我们介绍AgenticAI-Supervisor:一个API与UI驱动的RL Gym环境——把环境创建与可扩展执行解耦。通过转向可验证的执行结果,平台生成高保真轨迹并施加多维奖励塑形。关键是,框架经严格的内部状态验证与测试缓解奖励作弊。我们经客服智能体案例研究展示平台核心能力的初步面貌——展示一致的闭环反馈用于模型优化。后续工作将聚焦高级特性,如计算机使用、工具使用、自动“stumping”与边缘案例生成。

超越静态评估:为可扩展智能体强化学习构建仿真环境:论文配图
图 1. AgenticAI Supervisor 通过结合模拟环境、执行轨迹和多维奖励来实现可扩展、可验证的强化学习。屏幕阅读器对该图的文本描述。这是 ACM 模板所要求的。