论文

不同后训练阶段如何改变大语言模型的说服能力

Successive Training Stages and Large Language Model Persuasion: Effects of Misalignment, Supervised Fine-Tuning, and Preference Optimization

模型评测模型训练监督微调与指令调优偏好优化安全与风险评测

摘要

大型语言模型(LLM)可以通过调整来影响人类的态度,但连续的训练后阶段各自的贡献仍不清楚。本研究探讨了三个连续的训练阶段如何影响 LLM 说服力:(1) 通过对阴谋数据进行监督微调 (SFT) 的错位,(2) 对论证数据进行额外的说服性 SFT,以及 (3) 身份偏好优化 (IPO),一种偏好优化方法。在 Prolific 上招募的总共 835 名参与者被随机分配到 5 个主体间条件(中性文本、阴谋训练模型、说服训练模型、偏好优化模型和 GPT-4),并接触到关于 10 个有分歧的政治问题的文本,这些文本根据他们在所有模型条件下的个人资料进行个性化设置。态度变化是通过连续李克特量表上暴露前和暴露后位置之间的差异来测量的,并通过协方差分析(ANCOVA)进行分析。显着条件 x 基线态度交互作用 F (4, 825) = 5.33, p < .001,表明训练效果取决于参与者的初始态度。有说服力的 SFT 比单独的阴谋培训产生了更大的态度变化,d = 0.30,而 IPO 没有提供额外的好处,d = 0.03,GPT-4 与中性文本没有差异,d = --0.01。这些结果表明,对有说服力的数据进行有针对性的监督训练可以提高LLM的说服力,而偏好优化则不会带来任何其他显着的收益。