论文
StabilityBench:LLM 中的不稳定性基准测试
StabilityBench: Benchmarking Instability in LLMs
摘要
人工智能助手越来越多地部署在高风险环境中,例如医疗保健或政府服务。然而,由于强烈的环境依赖性,他们在现实世界中的行为仍然知之甚少。当前的评估协议遵循深度防御范式,具有复合层保护措施,范围从传统基准到实时或对抗性测试。此类基准在很大程度上仍然是静态的和单轮的,限制了它们捕获对话环境中现实世界变化的能力。我们提出了 StabilityBench,这是一个有原则的、通用的、与模型无关的基准操作符,它将单轮基准查询转换为多轮交互历史。 StabilityBench 通过人口统计代理或阿谀奉承的诱饵注入真实的用户模拟,同时保留原始的任务意图,从而增强了现有的基准。我们将 StabilityBench 应用于涵盖数学推理、健康问答和安全的四个基准,并在这些条件下评估九个 大语言模型。我们的结果表明,在这些注入下,模型性能始终不稳定,所研究的四分之三基准的性能显着下降。这些突出了静态评估的重要局限性,并激发了更现实的评估设置。为此,我们提出了 StabilityBench-Mini:StabilityBench 的一种保留尺寸的变体,可以跨多样化轴进行采样,从而在不增加成本的情况下实现更真实的评估。