论文
AliyunConsoleAgent:经蒸馏与强化学习在真实云环境中训练网页智能体
AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning
摘要
我们推出了 AliyunConsoleAgent,这是一个用于在现实云控制台中自动进行文档验证的 Web 代理框架。主要的云平台包含数百种产品,功能快速迭代,导致控制台 UI 经常与其相应的文档存在差异。验证记录的程序是否准确反映当前控制台并可以端到端执行,每年估计需要 400 万次重复检查,但手动覆盖率仍低于 1%。虽然基于前沿专有模型构建的代理系统取得了很高的成功率,但其高昂的成本和数据隐私限制阻碍了大规模部署。我们提出了一个两阶段的训练范式:对提炼的前沿模型轨迹进行监督微调(SFT),然后使用组相对策略优化(GRPO)和真实云环境中的双通道结果奖励模型进行强化学习。为了支持大规模强化学习训练,我们构建了一个高确定性的推出系统,具有基于 Terraform 的资源预配置和 LLM 驱动的按需配置,可有效地将环境噪声与训练信号隔离。我们进一步引入了基于后端审计日志的基于规则的奖励评估协议,提供客观的、抗奖励黑客的结果判断。我们的模型从遵循机械指令发展到通过云控制台和特定于产品的理解进行自主决策。在具有挑战性的 278 任务基准测试中,最佳前沿模型仅达到 65.34% 的实验表明,AliyunConsoleAgent-32B 实现了 63.52% 的平均成功率,比基本模型提高了 20.24 个百分点,将与最佳前沿专有模型的差距缩小到 1.82 pp(引导 95% CI [-1.27, 7.39])。推理成本降低 92%。
