论文

桥上的人:人工智能代理的可扩展评估

Human-on-the-Bridge: Scalable Evaluation for AI Agents

智能体系统Agent任务评测

摘要

人工智能代理必须作为行为系统进行评估,而不是作为孤立的响应生成器。他们进行轮流推理、调用工具、保留背景、遵循政策并在不确定的情况下采取行动。现有方法提供有用但分散的信号:基准衡量固定能力,人在环评审保留专家判断但不易扩展,LLM-as-judge 方法取决于评估者设计,红队通常是偶发性的,跟踪审计需要明确的证据规则。本文介绍了 Human-on-the-Bridge (HOB),这是一种用于代理 AI 的可扩展评估范例。 HOB 将人类专业知识置于上游,专家在测试开始之前策划可重用的评估情报,包括领域上下文、红队陷阱、陪审员角色、评分指南、审计规则和后备策略。然后,ProofAgent Harness 通过多回合对抗性评估、跟踪捕获、多陪审员评分和证据相关报告来重复执行这些精心策划的情报。我们通过跨基于 LLM 的前沿代理和 Harness LLM 层的对称和经济高效的非对称设置来评估 HOB。该研究涵盖了 23,500 个代理轮流,并在金融、医疗保健和代码生成方面得出了与证据相关的发现。结果表明,HOB 可以提高评估质量,而不需要同样大的评估器模型,从而允许较小的 Harness LLM 挑战建立在前沿 LLM 主干上的代理。静态基准测试和单一评估者评分经常会漏掉评估表面的失败,包括虚拟工具调用声明、缺少强制工具调用、策略漂移、操纵路径以及安全但无法解决的拒绝。这些发现支持 HOB 作为扩展人工评估智能的范例,其中专家判断被预先编码并在重复的代理评估中重复使用,而不是在每次运行中手动应用。