论文
HuatuoGPT-3:基于基础模型的仅 RL 域适应
HuatuoGPT-3: RL-Only Domain Adaptation from Base Models
摘要
领域适应旨在将通用大语言模型 (LLM) 转变为目标领域的专家。虽然占主导地位的 SFT+RL 管道提供了方便的冷启动,但它可能会减少探索多样性并通过多阶段优化引入额外的复杂性。这些限制激发了仅 RL 的适应。然而,纯 在策略 RL 存在冷启动问题,而混合策略 RL 仍然存在不足:教师模型输出中的信息丰富的token在早期的训练中学习得太慢,而过时的教师模型输出可能会阻碍后期的改进。我们将这两种故障模式识别为梯度饥饿和教师模型分布锚定。为了解决这些问题,我们提出了一级策略优化 (OnePO),它将教师模型输出视为策略改进的瞬态指导。 OnePO 结合自适应目标进化来加强对信息性低概率教师模型token和教师模型的学习,一旦当前的策略可以超越教师模型输出,就丢弃教师模型输出。在医疗适应方面,OnePO 仅用 20K 训练样本就在 HealthBench(总计)上取得了 67.2 分,分别比 SFT+RL 和纯 RL 好 2.7 分和 7.4 分。我们进一步对 OnePO 进行规模化,生产出开源医疗LLM系列 HuatuoGPT-3,其 27B 变体在 HealthBench(总计)上达到 70.1,在 HealthBench Professional 上达到 71.4,超越了 GPT-6 Astra 等前沿模型。型号和代码可在 https://github.com/FreedomIntelligence/HuatuoGPT-3. 获取
