技术实践

Snowflake用RLAIF训练面向临床病历生成的小模型

模型训练强化学习

概述

背景与问题:临床文档要把医患对话转成严格格式的SOAP病历,直接调用235B级通用模型只是零样本推理,成本高、延迟大且可靠性不足。方案与落地:Snowflake ML团队用RLAIF训练1.7B策略模型:先用Qwen3-235B-A22B合成19,939段医患对话,覆盖30个专科、400余种病症;再以GRPO替代监督微调——每个样本生成4个候选SOAP,0-5分评分中1分来自确定性代码校验(JSON含S/O/A/P四键),4分来自冻结的8B评审模型按事实准确、完整与临床恰当逐节打分,评审只验证不生成;全流程由Ray编排跑在Snowpark Container Services专用GPU池上。效果与数据:据介绍,在4,028条留出样本上,RL训练后的1.7B模型各节均追平或超过235B模型(规模仅约1/140),JSON合规率达99.98%,改善最明显在最需临床推理的Assessment与Objective节。作者强调LLM评审有主观性、分数不代表临床质量真值,可复用的是把质量标准写进奖励的方法,评审可替换或引入人工复核;1.7B模型可单GPU亚秒级推理,成本远低于235B调用。