论文

AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 基准

AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

智能体系统Agent任务评测

摘要

随着强化学习不断扩展基于大语言模型的智能体训练规模,在复杂环境中可靠地验证智能体行为变得越来越具有挑战性。现有方法依赖基于规则的验证器或 LLM-as-a-Judge 模型,它们难以泛化到狭窄领域之外。Agent-as-a-Judge 通过主动与环境及工具交互以获取可验证证据来解决这一局限,但其能力仍缺乏充分探索。我们提出基准 AJ-Bench,在搜索、数据系统与图形用户界面三个领域系统评估 Agent-as-a-Judge,包含 155 个任务与 516 条标注轨迹。该基准全面评估裁判智能体在信息获取、状态验证与过程验证方面的能力。实验表明其性能持续优于 LLM-as-a-Judge 基线,同时揭示了基于智能体的验证中仍存在大量开放挑战。我们的数据与代码见 https://aj-bench.github.io/。

AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 基准:论文配图
图 2:基准测试和评估流程概述。上半部分展示了基准构建过程,包括任务设计、轨迹收集和标签标注。下半部分描述了 Agent-as-a-Judge 的评估工作流程,其中环境在评估之前被初始化。