论文
LLMdoctor:面向大语言模型高效测试时对齐的 token 级流引导偏好优化
LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models
摘要
将大语言模型(LLM)与人类偏好对齐至关重要,但传统微调方法计算成本高且不灵活。测试时对齐提供了有前景的替代,但现有方法往往依赖失真的轨迹级信号或低效采样,从根本上限制了性能,也无法保留基座模型的生成多样性。本文提出 LLMdoctor,一个通过医患(patient-doctor)范式运作的高效测试时对齐新框架。它将 token 级奖励获取与 token 级流引导偏好优化(TFPO)相结合,用一个更小、专门化的医生模型来引导庞大的冻结患者 LLM。与依赖轨迹级奖励的传统方法不同,LLMdoctor 首先从患者模型的行为变化中抽取细粒度的 token 级偏好信号。这些信号随后通过 TFPO 指导医生模型的训练,TFPO 在所有子轨迹上建立流一致性,实现精确的逐 token 对齐,同时天然保留生成多样性。大量实验表明,LLMdoctor 显著优于现有测试时对齐方法,甚至超过 DPO 等全量微调方法的性能。
