论文
SEA-Eval:超越片段式评估的自进化智能体评估基准
SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
摘要
当前基于 LLM 的智能体在情景任务执行中表现出强大的性能,但仍然受到静态工具集和情景遗忘症的限制,无法跨任务边界积累经验或优化策略。虽然之前已经提出了自我进化代理(SEA)范式,但本文提出了基于数字化体现和持续跨任务进化的 SEA 的新形式定义,并介绍了 SEA-Eval,这是第一个旨在跨两个维度评估 SEA 特征、任务内执行可靠性和长期进化性能的基准。通过将任务组织成连续的流并分析一段时间内的成功率和token消耗,SEA-Eval 以现有情景基准无法实现的方式量化进化增益和结构稳定性。实证评估揭示了当前最先进框架中的一个显着的进化瓶颈,其中相同的成功率掩盖了高达 31.2 倍的token消耗差异以及序贯分析下不同的进化轨迹。 SEA-Eval 为将代理从单纯的任务执行者推进到真正自我进化的数字实体提供了严格的科学基础。
