论文

深入了解 LLM:利用 LLM 的内部工件增强法律分类的可靠性

Peeking Inside LLMs: Leveraging Internal Artifacts of LLMs for Enhancing Reliability in Legal Classification

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地在法律领域被采用。然而,尽管 LLM 性能强大,但它很容易生成不正确或幻觉的输出,引发人们对其在法律等高风险领域的可靠性的严重担忧。因此,检测基于 LLM 的系统响应的正确性是一项严峻的挑战。在这项工作中,我们探索了利用 LLM 的内部工件来检测其在法律领域分类任务中预测的正确性的潜力。我们开发的方法利用从这些内部工件派生的特征来构建能够识别不正确的 LLM 输出的下游分类器。我们在两个代表性的法律分类任务上评估我们的方法:保释决定预测和违法行为预测。我们的实验结果表明,LLM 的内部工件是检测法律分类任务中错误预测的可靠指标,并且可用于增强基于 LLM 的分类系统的可靠性。