论文
超越端点性能:自进化智能体的过程级评测
Beyond Endpoint Performance: Process-Level Evaluation of Self-Evolving Agents
摘要
自进化智能体将交互反馈转化为记忆、技能等持久产物,这些产物进而指导后续决策。随着产物在经验流中被迭代更新,它们所支撑的能力也可能随之演化。因此,仅看端点性能无法完整刻画自进化过程。过程级评测因而必不可少:它能识别目标能力何时涌现,以及后续更新是强化、保持还是削弱了该能力。基于此,我们提出 EvoPathBench,一个在产物级自进化过程中追踪单项能力的基准。EvoPathBench 固定基础模型与工具,在相继的检查点处冻结进化中的产物,并在留出片段上评估目标能力。该基准使用公开交易数据与校准轨迹评估智能体自进化,测试三种能力:对未见任务的泛化、无关学习后的保持,以及面对新证据的规则适应。实验结果显示:在相似未见任务上的收益在分布偏移下往往减弱;保持损失集中在少数进化路径上;没有任何方法能实现可靠的规则适应。此外,虽然自进化使智能体能够生成在留出集上有可观收益的候选产物,但被选中的更新始终未能兑现这一潜力。这些发现共同确立了能力级过程评估作为分析自进化的基础,并将候选产物的评估与选择定位为关键改进方向。