论文
大语言模型 中词汇对齐和偏好阶段转换的全自动识别
Fully Automated Identification of Lexical Alignment and Preference-Stage Shifts in Large Language Models
摘要
ChatGPT 等数字聊天助手使用的语言可能与人类的期望不同(不一致)。主要针对科学英语的研究描述了出现差异的原因,并在某种程度上描述了差异的原因,并将其与人类偏好学习的训练阶段联系起来。然而,现有的方法依赖于手动管理。本文介绍了两个无管理、轻假设的评估指标:词汇对齐得分(识别词汇过度使用)和三角偏好转变(量化此类转变中有多少可归因于人类偏好学习)。使用 PubMed 摘要,使用六个模型家族(Falcon、Gemma、Llama、Mistral、OLMo、Yi)的窗口文档流行率生成和测量连续性。该程序无需人工干预即可识别过度使用的项目,例如“建议”、“额外”和“策略”,并估计它们与偏好学习的联系。我们的研究结果复制了之前的工作,并且在参数设置、随机种子和对进一步数据的评估方面保持稳定。该方法可以轻松扩展,并能够系统地研究科学英语之外和跨语言的词汇(错误)对齐,因此,这些指标有可能有助于改善未来模型的对齐和对其起源的理解。