技术实践

淘宝直播以ASR逆向样本微调拟人化回复

模型训练应用与实践监督微调与指令调优合成数据语音交互与综合语音服务

概述

淘宝直播团队针对数字人直播 LLM 回复“AI感强、书面化”的问题,从真人直播 ASR 出发做逆向文本风格迁移:先对 ASR 做质量判定与逆向生成问题/商详、修复开头结尾截断与逻辑不通顺、过滤低质量样本,再按链接号、固定话术、数字一致性与语义相似度做内容一致性对齐,最终从 3w 条 ASR 中得到 3k+ 高质量 <AI感回复, 拟人化回复> 数据对;对比 qwen2.5 系列 1.5B/7B/72B 后,综合效果与推理延迟选择 Qwen2.5-7B-Instruct 做 SFT(learning_rate=2e-5、epoch=4、cosine),清洗后数据使初始与稳定 loss 均更低。