论文

EvoPolicyGym:评估交互环境中的自主策略演化

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

智能体系统模型训练强化学习Agent任务评测Agentic RL

摘要

自主智能体日益被期望通过反馈改进可执行策略——但既有评估常将该过程坍缩为最终分数——或将其与开放式软件工程进展混淆。我们引入自主策略演化——受控评估设置:测试框架模型智能体在固定交互预算下反复编辑可执行策略系统。我们在EvoPolicyGym中实例化该设置——由紧凑交互RL环境构建的基准——评估智能体如何迭代改进已探索策略。在EvoPolicyGym套件上:GPT-5.5取得最强聚合排名分数——并在全部16个环境中位居前二。超越排行榜结果——EvoPolicyGym还提供轨迹级诊断——区分智能体如何分配预算、如何将反馈转化为参数调优。这些分析表明强大的自主策略演化不仅依赖孤立的任务胜利——还依赖发现任务适配机制并在有界反馈下精炼策略。

EvoPolicyGym:评估交互环境中的自主策略演化:论文配图
图 1:EvoPolicyGym 框架。 (a) 交互循环:代理编辑策略,在有限预算下提交间歇性部署,并接收平台介导的反馈。 (b) 可见性边界:训练反馈是可见的,而基于验证的检查点选择和保留评估是隐藏的。 (c) 环境套件:在共享评估协议下跨越控制、导航、驾驶和机器人任务的统一界面。 (d) 衡量方面:反馈利用、预算效率和政策改进动态,通过迄今为止最佳绩效随时间的演变来获取。