论文

使生成式人工智能与人类偏好对齐:一种用于在线评论管理的新型大语言模型微调方法

Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management

模型训练偏好优化

摘要

在线评论在消费者的决策过程中发挥了关键作用。已有研究强调了商家评论回复对客户关系管理与企业绩效的显著影响。然而由于回复快速增长的网络评论需要大量人力,很大一部分在线评论仍未得到处理。尽管生成式AI在一系列任务中取得显著成功,但它们是通用模型,可能无法很好地与领域特定的人类偏好对齐。为了将这些通用生成式AI模型适配到领域特定应用,微调被普遍采用。然而在使用领域特定数据进行微调时仍存在若干挑战,包括幻觉、难以表达领域特定的人类偏好,以及离线策略优化中的过度保守。为应对这些挑战,我们提出一种新的偏好微调方法,使LLM与领域特定的人类偏好对齐以生成在线评论回复。具体而言,我们首先识别幻觉的来源,并提出一种有效的上下文增强方法来缓解LLM幻觉。为表达人类偏好,我们提出一种理论驱动的新型偏好微调方法,在在线评论领域自动构建人类偏好对。此外,我们提出一种课程学习方法进一步增强偏好微调。为克服现有离线偏好微调方法过度保守的挑战,我们提出一种基于密度估计的支持约束方法来放松保守性,并从数学上证明了其更优的理论保证。大量评估证实了所提偏好微调方法的优越性。