论文

模型知道什么,他们知道多少:用于学习何时说“我不知道”的知识加权 微调

What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"

模型训练监督微调与指令调优

摘要

虽然 大语言模型 (LLM) 在不同的用户查询中展示了强大的能力,但他们仍然遭受幻觉的困扰,这通常是由于 预训练 和 微调 之间的知识不一致引起的。为了解决这种不一致问题,我们通过多采样推理可靠地估计了细粒度的实例级知识得分。使用知识得分,我们根据模型的现有知识来缩放学习信号,同时鼓励对范围外的查询做出明确的“我不知道”响应。实验结果表明,这种方法允许模型在缺乏知识时明确表达不确定性,同时保持其可以回答的问题的准确性。此外,我们提出了不确定性的评估指标,表明已知和未知实例之间的准确区分能够持续提高性能。