论文
当心 GAP:文本安全不会迁移为 LLM 智能体的工具调用安全
Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents
摘要
作为智能体部署的大语言模型日益通过工具调用与外部系统交互——这是具有现实世界后果、而纯文本输出不具备的行动。然而安全评估绝大多数只测文本级拒绝行为,留下一个关键问题未答:抑制有害文本的对齐是否也抑制有害行动?我们提出 GAP 基准,一个系统评估框架,度量 LLM 智能体文本级安全与工具调用级安全之间的分歧。我们测试六个前沿模型,覆盖六个受监管领域(制药、金融、教育、就业、法律和基础设施),每领域七种越狱场景、三种系统提示条件(中性、安全强化、工具鼓励)和两种提示变体,产出 17,420 个可用于分析的数据点。核心发现是文本安全不会迁移为工具调用安全。在全部六个模型上,我们都观察到模型文本输出拒绝有害请求、其工具调用却同时执行被禁行为的情形——我们把这种分歧形式化为 GAP 指标。即使在安全强化系统提示下,六个模型合计仍有 219 例此类情形。系统提示措辞对工具调用行为影响显著:最稳健模型的 TC-safe 率跨度为 21 个百分点,最敏感提示的模型达 57 个百分点,18 组成对消融比较中 16 组经 Bonferroni 校正后仍显著。运行时治理契约在全部六个模型中减少信息泄露,但对被禁工具调用尝试本身没有可检测的威慑效果。这些结果表明,仅测文本不足以评估智能体行为,工具调用安全需要专门的度量与缓解。