论文
OpenSec:测量对抗证据下事件响应智能体的校准
OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence
摘要
随着大语言模型的改进,它们的攻击性应用程序也在不断改进:前沿代理现在可以以低于 50 美元的计算成本生成可用的漏洞(Heelan,2026)。防御性事件响应 (IR) 代理必须跟上步伐,但现有基准将行动执行与正确执行混为一谈,在代理处理对抗性证据时隐藏校准失败。我们引入了 OpenSec,这是一种双控制强化学习环境,可在真实的提示注入场景下评估 IR 代理。与静态能力基准不同,OpenSec 通过基于执行的指标,在对抗性证据下对改变世界状态的遏制行动进行评分:首次遏制时间 (TTFC)、爆炸半径(每集误报)和注入违规率。通过评估 40 个标准层剧集上的四个前沿模型,我们发现在此设置中存在一致的过度触发:GPT-5.2、Gemini 3 和 DeepSeek 在 100% 的剧集中执行遏制,误报率为 90-97%。 Claude Sonnet 4.5 显示了部分校准(85% 遏制,72% FP),表明 OpenSec 暴露了被聚合成功指标隐藏的校准失败模式。代码可在 https://github.com/jbarnes850/opensec-env 获取。
