论文

SEAGym:自演化LLM智能体的评估环境

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

智能体系统模型训练强化学习Agent HarnessAgent任务评测智能体自我改进Agentic RL长程任务评测

摘要

自演化的基于LLM的智能体主要通过改变其智能体测试框架(harness)改进——harness是围绕基座模型的结构化执行层——包括提示、记忆、工具、中间件、运行时状态与模型-工具交互循环。既有评估常把该过程简化为孤立任务分数或单一顺序曲线——掩盖更新是否产生可复用改进、过拟合近期任务、增加成本或损害旧行为。我们介绍SEAGym——跨训练、验证、测试、重放与成本记录测量智能体harness更新的评估环境。SEAGym把兼容Harbor的基准转为动态自演化任务源——带训练批次、冻结的更新验证、留出的同分布与OOD迁移视图、重放诊断——以及保存的快照与指标记录。在Terminal-Bench 2.0与HLE上实例化SEAGym——我们在共享epoch/批次协议下比较ACE、TF-GRPO与AHE。结果表明这些评估视图提供关于演化过程的互补信号:频繁更新可能无法改进留出性能——有用的中间快照可能后期崩溃——源多样性与模型后端会影响harness可靠性。

SEAGym:自演化LLM智能体的评估环境:论文配图
图 1:SEAGym 概述。该环境对训练批次进行采样,运行任务片段,记录轨迹和验证者反馈,让自我进化代理更新自己的状态,并将评估点记录为冻结快照。快照质量通过冻结更新验证、最终保留测试、重放诊断和成本指标来衡量。