论文

迈向轻量级可靠性:在 大语言模型 中使用软提示缓解幻觉

Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models

模型训练参数高效训练

摘要

大语言模型 (LLM) 已在各个领域得到广泛采用,但其可靠性经常受到幻觉的破坏——这些幻觉听起来似乎合理,但实际上是错误的。在高风险领域,这些错误可能会降低信任并引入现实风险。为了应对这一挑战,我们提出了一种参数有效的方法,该方法使用软提示来减轻幻觉内容并促进生成问答(QA)任务中负责任的放弃。我们的方法称为负责任对比软提示(RCSP),使用复合损失来训练平衡三个目标的软提示:抑制幻觉内容、鼓励不确定性下的弃权以及保留或提高事实回忆。为了实现这些目标,我们将对比损失、课程学习和 KL 正则化纳入我们的训练机制中。我们使用 LLM-as-a-Judge 框架在五个不同的生成 QA 数据集上评估我们的方法。 Gemma 3 (12B) 和 Llama 3.1 (8B) 主干上的实验结果表明,RCSP 有效地平衡了事实回忆与幻觉抑制和弃权,产生了优于标准推理和基于指令的提示基线的 F 分数。值得注意的是,这些改进是通过仅训练其他调整技术所需的一小部分参数来实现的。我们的结果表明,软提示为提高 LLM 可靠性提供了一条模块化且计算高效的途径。