论文

大型语言模型中的特定领域术语:通用模型和专业模型之间的比较分析

Domain-Specific Jargon in Large Language Models: A Comparative Analysis between General-Purpose and Specialist Models

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 在通用任务上表现出了卓越的熟练程度,但在高度专业化的技术领域,它们的性能往往会下降。此外,人们对特定领域术语的参数知识如何在这些模型中进行编码知之甚少。我们通过提供两个新颖的医学术语评估基准来解决这一差距,并根据医学领域数据微调的变体评估通用 Llama-3.1 模型。令人惊讶的是,通用模型在这两项任务上都优于医学微调模型。使用机械解释工具,我们发现了医学微调模型的系统错误校准模式。微调模型没有重新组织参数知识,而是更加重视与行话预测相关的一小部分模型组件。我们发现,针对基准任务应用组件重新加权策略成功地抑制了这些组件并缩小了与通用基线的差距。我们还观察到,一些对术语敏感的组件将知识转移到涉及材料科学术语的相同任务中,这表明它们编码了部分与领域无关的专业术语概念。我们的结果提供了一个案例研究,其中经过医学微调的检查点并没有提高其通用对应检查点的术语理解力,这强调不应假设领域适应可以在专业术语上产生更好的性能。