论文
人工智能安全评估的对抗性语用学:语言介导控制的诊断框架和种子基准
Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control
摘要
对语言模型的安全评估越来越依赖于对模糊自然语言行为的判断:模型是否遵循指令、适当拒绝、遵守政策或误报代理任务的进度。现有的基准将这些压缩为通过/失败标签,模糊了失败是否反映了能力限制、政策模糊性、指令冲突、支架故障或不稳定的评估者判断。对抗性语用学是指令冲突、嵌入命令、引用、范围模糊、指示语和间接言语行为下的与安全相关的模型行为。它旨在扩展到多轮代理转录本,但种子集代表该家族与单轮工具结果对比。本文介绍了一个诊断框架、一个 18 项种子基准、一个 54 行试点和一个六单元 LLM 法官评估,以及一个将任务成功、政策合规性、风险、拒绝、归因和置信度分析分开的协议。该基准将单个标签可以隐藏的四个推理目标分开:制度相关参考、配置系统行为、评估器输出解释和分类分配。其预期用途是诊断,而不是部署认证、供应商排名或一般安全评分。第一个 LLM 法官用可见的预期答案对自己的输出进行评分,错过了与安全相关的少数群体。项目聚类间隔使得六个机会校正一致性统计中的四个无法排除恒定标签,而分层池将一个引人注目的标题效应缩小到组平均值,并将其间隔扩大到零。通过三个判断模型和两个信息条件重新判断对象,使模式保持完整:没有一个单元恢复十一个部分成功中的两个以上,并且最强单元的边缘部分来自于从未使用该标签。