论文
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 基准
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
摘要
随着强化学习不断扩展基于大语言模型的智能体训练规模,在复杂环境中可靠地验证智能体行为变得越来越具有挑战性。现有方法依赖基于规则的验证器或 LLM-as-a-Judge 模型,它们难以泛化到狭窄领域之外。Agent-as-a-Judge 通过主动与环境及工具交互以获取可验证证据来解决这一局限,但其能力仍缺乏充分探索。我们提出基准 AJ-Bench,在搜索、数据系统与图形用户界面三个领域系统评估 Agent-as-a-Judge,包含 155 个任务与 516 条标注轨迹。该基准全面评估裁判智能体在信息获取、状态验证与过程验证方面的能力。实验表明其性能持续优于 LLM-as-a-Judge 基线,同时揭示了基于智能体的验证中仍存在大量开放挑战。我们的数据与代码见 https://aj-bench.github.io/。
