技术实践
淘宝直播以GRPO和奖励模型训练拟人化互动
概述
为压缩“生成回复→拟人化改写”两阶段链路的延迟,团队用改写模型批量生成数据对训练 BERT 二分类拟人化判别模型(去除固定开头结尾、引入 1k+ 非互动数据、对正负例 top50 词做掩码以防作弊),先做 do-sample 验证判别有效性;随后将其作为风格奖励加入原有正确性、帮助性奖励,并把目标回复长度设为 1.2–1.5 倍,基于 Qwen3-30B-A3B 做 GRPO 训练:约 200 步时拟人化与长度奖励已较高,600 步后趋于稳定;测试集准确率 92.0%、帮助性 97.0%,人工评估 85.5% 的用例音频效果优于线上。