论文

BenchTrace:测试LLM智能体反思能力与受控演化的基准

BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents

智能体系统Agent任务评测智能体自我改进

摘要

自演化智能体通过反思过去的失败随时间改进,但现有评估存在两方面局限:只测任务分数而让反思质量无从知晓,并且依赖智能体自身的运行记录,缺乏针对特定失败模式的机制。我们提出BenchTrace,一个评估LLM智能体自演化能力的基准。BenchTrace建立在涵盖六种不同任务、共1,821个已标注回合的快照-反思数据集之上,包含两部分:反思评估(Reflection Evaluation)通过针对性QA任务考察失败识别能力;演化评估(Evolution Evaluation)在受控的自演化模拟中检验过往失败经验能否转化为规避行为。基于BenchTrace,我们提出失败规避率(failure avoidance rate,FAR)这一新指标,衡量智能体成功避开目标失败实例的测试用例占比。在Qwen3-32B和GPT-4.1上的实验显示,两个模型在反思评估上的端到端通过率均低于30%,诊断是主要瓶颈。演化评估表明,自演化方法普遍比不演化的基线提升FAR,但随着噪声回合的累积,智能体会忘记早期教训,且其反思无法泛化到具体情境之外,导致跨任务情境的负迁移。我们的相关性分析进一步表明,只有完全正确的反思才与更高的FAR强相关。BenchTrace揭示了当前自演化方法的具体局限,并提供了一个受控的、与模型无关的定向评估框架。

BenchTrace:测试LLM智能体反思能力与受控演化的基准:论文配图
图 1:(a) 自我进化智能体的传统评估仅衡量最终任务得分。 (b) BenchTrace 通过三个阶段构建其数据集:快照收集、故障检测和反射注释。 (c) BenchTrace 包括快照反射数据集和具有反射评估和演化评估的评估套件。