论文

HAL:通过对齐使LLM具有类人性

HAL: Inducing Human-likeness in LLMs with Alignment

模型训练奖励建模与过程监督

摘要

人类对话相似度在人机交互中发挥着核心作用,但它仍然难以定义、衡量和优化。因此,类人行为的改善很大程度上是由规模或广泛的监督训练驱动的,而不是有针对性的调整。我们引入了人类对齐大语言模型(HAL),这是一个使用可解释的、数据驱动的奖励将语言模型与人类对话相似性对齐的框架。 HAL 从对比对话数据中得出明确的对话特征,将它们组合成紧凑的标量分数,并使用该分数作为透明的奖励信号,以与标准偏好优化方法保持一致。使用这种方法,我们可以调整不同大小的模型,而不影响其整体性能。在大规模人类评估中,与 HAL 一致的模型在对话中更常被认为与人类相似。由于 HAL 在明确的、可解释的特征上运行,因此它可以检查对齐行为并诊断意外影响。更广泛地说,HAL 展示了如何以可解释和可解释的方式测量和对齐语言的软性、定性属性(以前超出了对齐的范围)。

HAL:通过对齐使LLM具有类人性 配图
图 1:HAL 流水线:(a) 从对比对话(例如图灵测试)中识别类人特质;(b) 通过代理分类任务学习特质权重;(c) 计算用于对齐的类人度得分。