论文
ProofAgent Harness:用于人工智能代理对抗性评估的开放基础设施
ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents
摘要
人工智能代理正在进入高风险的生产环境,他们在其中使用工具、保留上下文、遵循策略、处理私人数据并与用户进行多次交互。然而,许多评估方法仍然判断孤立的输出或静态任务,忽略了通过轨迹、压力和对抗性交互而出现的失败。我们推出了 ProofAgent Harness,这是一种用于可扩展、可审计和对抗性 AI 代理评估的开放基础设施。该工具提供了围绕代理的评估基础设施:它管理评估情报,运行对抗性多轮试验,捕获行为痕迹,应用事后多陪审员评分,解决分歧,并生成与证据相关的报告。其开放式设计允许开发人员和研究人员扩展领域、陷阱、指标、陪审员角色、评分规则和报告格式。其核心是具有回合级审计的对抗性多陪审员评分,它使用经过校准的陪审员角色、共识检查和回合级证据来评估压力下完整的代理行为。跨客户支持、医疗分诊、隐私和安全以及代码生成代理的实验表明,强大的代理会通过薄弱的指标、脆弱的转向、不安全的重构和操纵路径选择性地失败。我们还发现,小型量化本地Harness LLM 可以挑战由一流的大型 LLM 提供支持的生产代理,这表明评估能力来自整个Harness管道,而不仅仅是模型规模。 ProofAgent Harness 将 AI 代理评估从静态评分转变为可扩展的对抗性评估基础设施:在部署之前可重复、有证据支持、可扩展且可操作。