论文
大语言模型的对抗性道德压力测试
Adversarial Moral Stress Testing of Large Language Models
摘要
评估部署于软件系统中的大语言模型(LLM)的伦理稳健性仍然困难,尤其在持续对抗性用户交互之下。现有安全基准通常依赖单轮评估与聚合指标(如毒性得分与拒答率),对真实多轮交互中可能出现的行为不稳定只能提供有限的可见性。因此,罕见但高影响的伦理失效与渐进式退化效应可能在部署前未被察觉。本文提出对抗性道德压力测试(AMST),一个用于评估对抗性多轮交互下伦理稳健性的基于压力的评估框架。AMST对提示施加结构化压力变换,并通过分布感知的稳健性指标评估模型行为,这些指标捕捉交互轮次间的方差、尾部风险与时间维度上的行为漂移。我们在多个SOTA LLM(包括LLaMA-3-8B、GPT-4o与DeepSeek-v3)上,使用在受控压力条件下生成的大量对抗场景评估AMST。结果显示各模型的稳健性画像存在显著差异,并暴露出传统单轮评估协议下不可见的退化模式。特别地,稳健性已被证明取决于分布稳定性与尾部行为,而非仅取决于平均性能。此外,AMST提供了一种可扩展、模型无关的压力测试方法,可对运行于对抗环境的LLM软件系统进行稳健性感知的评估与监控。
