论文
并非所有流畅的内容都是事实:调查学术写作中 大语言模型 的幻觉
Not All That Is Fluent Is Factual: Investigating Hallucinations of Large Language Models in Academic Writing
摘要
大语言模型(LLM)表现出非凡的能力,但它们仍然容易产生幻觉,特别是当我们使用它们来生成学术内容时。我们专门针对学术写作的幻觉研究了四种流行的 LLM、ChatGPT、Grok、Gemini 和 Copilot。我们设计了 80 个提示,分为四个类别,即参考文献生成、事实解释、摘要生成和写作改进。我们使用 0-5 的评分标准来评估该模型,该评分检查事实准确性、参考有效性、连贯性、风格一致性和学术基调。引入了一种新颖的加权指标——幻觉指数(HI)来衡量模型生成的响应中的幻觉。一些最广泛使用的评估指标通常无法检查改变机器翻译文本中的情绪的错误。我们发现 Grok 和 Copilot 在参考生成任务上表现更好,但他们经常在抽象或文体提示上遇到困难,HI 值分别为 0.67 和 0.70。而 Gemini 和 ChatGPT 在语气控制方面表现良好,但在撰写事实性任务方面表现欠佳,且幻觉风险较高,HI 得分分别为 0.53 和 0.57。我们的研究发现,幻觉行为不仅仅取决于模型架构,还取决于我们提供的任务类型和提示条件。我们建议我们的工作为未来的研究人员开辟新的研究维度。