论文

大语言模型中隐藏的可靠性风险:精度导致输出分歧的系统性识别

Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements

模型评测鲁棒性、公平性与可信度评测

摘要

为满足效率和资源约束,大语言模型(LLM)越来越多地在多种数值精度配置下部署,包括标准浮点格式(如bfloat16和float16)和量化整数格式(如int16和int8)。然而,不同精度的LLM之间的细微不一致难以检测,且常被现有评估方法忽视。本文提出PrecisionDiff,一个用于系统性检测LLM中精度引起的行为分歧的自动化差分测试框架。PrecisionDiff生成精度敏感的测试输入并进行跨精度对比分析,以发现在传统测试策略下仍然隐蔽的细微分歧。为展示其实际意义,我们将PrecisionDiff实例化于对齐验证任务,在该任务中精度引起的分歧表现为越狱分歧——在某一种精度下被拒绝的输入,在另一种精度下可能产生有害响应。实验结果表明,这类行为分歧在多个开源对齐LLM和精度设置中普遍存在,且PrecisionDiff在检测这些问题上显著优于普通测试方法。我们的工作实现了自动化的精度敏感测试生成,有助于有效的部署前评估,并改进训练过程中的精度鲁棒性。

大语言模型中隐藏的可靠性风险:精度导致输出分歧的系统性识别:论文配图
图 1。相同的对抗性提示可能会在不同数值精度设置下运行的 LLM 实现中触发不一致的行为,从而激发对精度引起的行为分歧的系统研究。显示的后缀由 PrecisionDiff 生成。