论文
EvoPolicyGym:评估交互环境中的自主策略演化
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
摘要
自主智能体日益被期望通过反馈改进可执行策略——但既有评估常将该过程坍缩为最终分数——或将其与开放式软件工程进展混淆。我们引入自主策略演化——受控评估设置:测试框架模型智能体在固定交互预算下反复编辑可执行策略系统。我们在EvoPolicyGym中实例化该设置——由紧凑交互RL环境构建的基准——评估智能体如何迭代改进已探索策略。在EvoPolicyGym套件上:GPT-5.5取得最强聚合排名分数——并在全部16个环境中位居前二。超越排行榜结果——EvoPolicyGym还提供轨迹级诊断——区分智能体如何分配预算、如何将反馈转化为参数调优。这些分析表明强大的自主策略演化不仅依赖孤立的任务胜利——还依赖发现任务适配机制并在有界反馈下精炼策略。
