论文
无需训练可信大语言模型方法的系统研究
A Systematic Study of Training-Free Methods for Trustworthy Large Language Models
摘要
随着 大语言模型 (LLM) 受到越来越多的关注并在各个领域部署,它们的潜在风险,包括生成有害或有偏见的内容、产生不受支持的声明以及表现出对抗性攻击的漏洞,引起了人们的广泛关注。为了实现快速且低成本的适应,无需训练 方法最近已成为 后训练 对齐技术的经济高效替代方案。尽管取得了令人鼓舞的结果,但这些方法在文献中的评估不一致,涵盖的可信度有限,并且可能带来不良的副作用,例如效用下降和脆弱性增加。为了全面评估这些 无需训练 方法的影响,我们退后一步,系统地重新评估现有 无需训练 方法针对各种可信设置的有效性及其对实用性、鲁棒性和计算开销的影响。我们还根据这些方法在推理过程中干预模型信息流的位置将它们分为三个级别(输入、内部和输出)。使用这种分类法,我们对不同 LLM 系列和规模的各个级别的各种代表性和有效方法进行了全面分析。我们的分析强调了当前方法中的一些权衡和未解决的挑战。我们总结了现有文献中的主要发现和局限性,并提出了在 LLM 中平衡可信性、实用性和鲁棒性的实用建议,而无需额外的训练。