论文

改进跨领域智能体评估方法:敏感信息泄露、欺诈与网络安全威胁

Improving Methodologies for Agentic Evaluations Across Domains: Leakage of Sensitive Information, Fraud and Cybersecurity Threats

模型评测评测方法与指标

摘要

自主 AI 系统的迅速崛起与智能体能力的进步,由于对真实世界互动的监督减少而引入新风险。然而智能体测试仍处于起步阶段,是一门仍在发展的科学。随着 AI 智能体开始全球部署,它们必须准确且安全地处理不同语言与文化。为此,国际高级 AI 测量、评估与科学网络的参与者——包括来自新加坡、日本、澳大利亚、加拿大、欧盟委员会、法国、肯尼亚、韩国与英国的代表——齐聚一堂,对齐智能体评估方法。这是第三次演练,建立在该网络 2024 年 11 月与 2025 年 2 月两次联合测试的洞见之上。目标是进一步打磨测试先进 AI 系统的最佳实践。演练分为两个方向:(1) 由新加坡 AISI 牵头的共性风险,包括敏感信息泄露与欺诈;(2) 由英国 AISI 牵头的网络安全。多种开放与闭源权重模型针对来自各种公开智能体基准的任务进行评估。鉴于智能体测试的初创性质,我们的主要焦点是理解进行此类测试的方法学问题,而非检视测试结果或模型能力。这一合作标志着参与者在推进智能体评估科学方面共同迈出的重要一步。