论文
SEAGym:自演化LLM智能体的评估环境
SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
摘要
自演化的基于LLM的智能体主要通过改变其智能体测试框架(harness)改进——harness是围绕基座模型的结构化执行层——包括提示、记忆、工具、中间件、运行时状态与模型-工具交互循环。既有评估常把该过程简化为孤立任务分数或单一顺序曲线——掩盖更新是否产生可复用改进、过拟合近期任务、增加成本或损害旧行为。我们介绍SEAGym——跨训练、验证、测试、重放与成本记录测量智能体harness更新的评估环境。SEAGym把兼容Harbor的基准转为动态自演化任务源——带训练批次、冻结的更新验证、留出的同分布与OOD迁移视图、重放诊断——以及保存的快照与指标记录。在Terminal-Bench 2.0与HLE上实例化SEAGym——我们在共享epoch/批次协议下比较ACE、TF-GRPO与AHE。结果表明这些评估视图提供关于演化过程的互补信号:频繁更新可能无法改进留出性能——有用的中间快照可能后期崩溃——源多样性与模型后端会影响harness可靠性。
