论文
迈向规范学习:从偏好对进行推理时间对齐
Towards Spec Learning: Inference-Time Alignment from Preference Pairs
摘要
引导 大语言模型 (LLM) 实现所需的行为通常依赖于根据对模型响应的仔细检查手工制作提示的迭代过程。这是一个复杂、脆弱且容易出错的过程。基于偏好的 微调 是一种更严格但通常昂贵的解决方案。我们提出规范学习,这是一个依赖于简短的用户指令和一小组偏好判断的框架。这些内容被编译成 LLM 自然语言提示形式的规范。规范在推理时条件为 LLM,并且不需要对底层模型进行参数更新。我们表明,在来自偏好信号密集的专门领域的数据集上,基于编译的规范生成的响应通常优于直接偏好优化(DPO)。与不透明的权重更新不同,生成的规范是人类可读的,并且可以作为产生它们的偏好信号的可解释和透明的书面实施例。