论文

BLINDSPOT:长周期工具智能体的安全与拒绝校准基准

BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents

智能体系统Agent任务评测长程任务评测

摘要

大模型智能体日益运行于涉及工具、持久状态、变化授权和外部反馈的长周期交互中。安全失败可能多轮后才出现,但现有评估常简化为任务或攻击是否成功,遮蔽了智能体是否恰当行动、拒绝并随交互保持校准。我们提出轨迹级安全校准基准Blindspot,通过自适应对抗交互、有状态工具执行和执行依据裁决评估完整用户—智能体—环境轨迹。当前版本有七个领域的22类攻击与35个场景,产生超过2500条长周期轨迹,平均14.7轮。每条分为安全完成、正确拒绝、不安全完成、过度拒绝或不确定五种结果。不同于固定攻击集,它是可扩展实时模拟框架,新增攻击、场景、工具、策略、领域和智能体配置无需重设计流水线。我们用八项指标评估13个闭源及开放权重模型,覆盖不安全完成、适当拒绝、良性效用、过度拒绝、重复运行鲁棒性和拒绝后失败。初步结果显示模型安全与效用校准差异明显,失效可能在若干起初安全的步骤后才出现,因此安全应视为轨迹属性而非单轮或二元成功标准。

BLINDSPOT:长周期工具智能体的安全与拒绝校准基准:论文配图
图1:Blindspot总览。基于策略规则的场景初始化用户智能体、目标智能体、工具及环境状态,长程交互形成包含消息、工具执行、观察与状态转换的轨迹。执行与策略证据、语义判断及人工复核共同支持将结果划入五类之一。