论文
HAL:通过对齐使LLM具有类人性
HAL: Inducing Human-likeness in LLMs with Alignment
摘要
人类对话相似度在人机交互中发挥着核心作用,但它仍然难以定义、衡量和优化。因此,类人行为的改善很大程度上是由规模或广泛的监督训练驱动的,而不是有针对性的调整。我们引入了人类对齐大语言模型(HAL),这是一个使用可解释的、数据驱动的奖励将语言模型与人类对话相似性对齐的框架。 HAL 从对比对话数据中得出明确的对话特征,将它们组合成紧凑的标量分数,并使用该分数作为透明的奖励信号,以与标准偏好优化方法保持一致。使用这种方法,我们可以调整不同大小的模型,而不影响其整体性能。在大规模人类评估中,与 HAL 一致的模型在对话中更常被认为与人类相似。由于 HAL 在明确的、可解释的特征上运行,因此它可以检查对齐行为并诊断意外影响。更广泛地说,HAL 展示了如何以可解释和可解释的方式测量和对齐语言的软性、定性属性(以前超出了对齐的范围)。
