论文
通过多遍提示验证提高定性分析中的量化模型性能
Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification
摘要
量化 大语言模型 (LLM) 在定性分析中更常用,因为它们运行速度快且需要较少的计算资源。本研究探讨了不同的低位量化级别(8 位、4 位、3 位和 2 位)和量化类型如何影响 LLaMA-3.1 (8B) 的定性分析性能。该研究使用了来自 82 份访谈记录的专家和非专家的回答。低位模型通常会产生更高水平的幻觉和不稳定的结果,尤其是在阅读术语不明确的非专家语言时。为了提高性能,我们提出了一种量化感知的多遍提示验证方法。该方法通过受控步骤引导模型减少幻觉。它会删除不可靠的内容,并在验证后将结果传递到下一个成绩单,从而提高准确性。为了验证性能,人类编码人员使用 NVivo 和 BF16 LLaMA 分析了转录本。 BF16 LLaMA-3.1 产生高精度输出,但存在语义漂移和幻觉。这些错误已被手动更正。校正后的 BF16 输出和 NVivo 人类编码相结合,创建了用于主题提取和频率分析的人工参考真值 (GSGT)。结果表明 8 位模型最接近 GSGT。当应用所提出的方法时,4 位模型会失去准确性,但会变得稳定。由于严重压缩,3 位和 2 位模型的性能有所下降,但通过建议的即时设计和验证,它们的性能得到了改善。研究还发现,同一位级别的模型根据量化类型的不同而表现不同。总体而言,该方法有助于低资源LLM变得更加稳定、准确,并且适合以更低的成本进行定性研究。