论文

ScopeBench:目标压力下智能体是否遵守渗透测试边界

ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure?

智能体系统Agent任务评测

摘要

智能体已在 Web 应用和网络渗透测试中获得实际自主权,一次越界行为就可能突破客户授权。现有攻防基准主要衡量攻击能力,随着其趋于饱和,部署障碍转向对齐的具体问题:范围遵守。ScopeBench 包含 30 个“死路”Agentic 安全任务,所述目标只能通过违反范围达成。每个任务有两种条件,共用环境、验证器和目标,仅范围不同:无范围指令测能力,自然语言范围指令测遵守程度。无范围轨迹由标准确定性验证器评分;有限范围轨迹有两个评分分支。首先,同一验证器检查目标标志,由于标志在范围边界后,验证通过便可确定出现禁止行为,提供高精度违规率下界。若未通过,则由智能体裁判估计是否有越界调用。研究以人工逐调用标注的 100 条轨迹校准裁判;对评测轨迹的盲审中,36 次已审违规没有漏报,唯一观察到的错误是过度标记。在同一运行框架的八个模型上,原始能力为 12.2%—81.1%,范围遵守率为 34.4%—86.7%;裁判找到机械验证遗漏的 331 次违规。Opus-4-8 的原始能力比 sonnet-4-6 高 10 个百分点,同时范围遵守率高 35.6 个百分点。研究公开冻结的试点基准、评测代码和全部 2,160 条 ATIF 轨迹。