论文

HINTBench:地平线代理固有非攻击轨迹基准

HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

智能体系统模型评测Agent任务评测安全与风险评测

摘要

现有的药物安全评估主要关注外部诱发的风险。然而,在良性条件下,智能体仍可能进入不安全的轨迹。我们通过\emph{内在}风险的视角来研究这种互补但尚未充分探索的环境,其中内在的失败仍然是潜在的,在长期执行中传播,并最终导致严重后果的结果。为了评估这种设置,我们引入了 \emph{非攻击内在风险审计},一种面向防护的安全评估任务,并提出了 \textbf{HINTBench},这是 596 个智能体轨迹的基准,其中包括 400 条合成风险轨迹、136 条合成安全轨迹、30 条重建的现实世界风险轨迹和 30 条重建的现实世界安全轨迹,平均长度为24.0 步。 HINTBench 支持三项任务:风险检测、风险步骤定位和内在故障类型识别,并在统一的五约束分类下组织注释。实验揭示了巨大的能力差距:强大的 LLM 在轨迹级风险检测上表现良好,但在细粒度 Strict-F1 上用于风险步骤定位的最佳模型仍然低于 37。在本机提示下评估的现有现成防护模型很难迁移到此设置。这些发现将内在风险审计确定为对代理安全的公开挑战。