论文

评估即时扰动对大语言模型中的偏差和幻觉的影响

Evaluating the Effects of Prompt Perturbation on Bias and Hallucination in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)在各种自然语言处理任务中表现出了卓越的能力,导致它们作为决策环境中的智能助手被广泛部署。然而,这些模型日益复杂,引起了人们对其可靠性的担忧,特别是在偏见和幻觉方面。在这项工作中,我们评估了大语言模型对决策任务中原始查询的扰动变化的鲁棒性。我们表明,与之前的研究相反,相对于其他模型,扰动可以减轻某些大语言模型的偏见和幻觉。研究发现,Claude 3 对于大多数数据集中表示的任务更为有效,而 GPT3.5 等模型则表现出不同程度的充分性,在某些情况下表现相当,但在其他情况下明显落后。这些见解对于理解在现实应用中部署基于大语言模型的助手作为有效决策支持工具的实际影响至关重要,强调需要严格的测试和验证以确保可靠性和有效性。这项研究为越来越多的大语言模型评估研究做出了贡献,并为在关键决策环境中开发更强大、更值得信赖的人工智能助手提供了见解。