论文

SLM 的可信度基准测试:预训练与压缩

Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

模型评测鲁棒性、公平性与可信度评测

摘要

小语言模型 (SLM) 已成为传统 大语言模型 (LLM) 的更有效替代方案,在资源受限的场景中提供了广阔的前景。构建 SLM 的现有方法通常遵循两条路径:从头开始训练紧凑模型,或使用剪枝、量化或 蒸馏 等方法压缩更大的预训练模型。随着语言模型越来越多地集成到现实世界的应用程序中,确保其可信度已成为一个关键问题。然而,如何构建值得信赖的 SLM 仍然是一个尚未探索的问题。在这项工作中,我们从多个维度对 SLM 可信度进行了全面评估,包括公平性、鲁棒性、隐私性和道德性。我们首先检查剪枝和量化的效果,发现量化在保持可信度方面比剪枝更有效。更重要的是,我们证明,与使用从头开始训练的小模型相比,通过量化压缩可靠的大型模型可以产生具有卓越可信度和适应性的 SLM。此外,来自值得信赖的教师模型的知识蒸馏可以进一步增强SLM的可靠性。我们希望我们的研究结果为未来研究可信赖的小语言模型的开发和部署提供实用指导和基础。