技术实践
小红书以实时语音识别实现拜年字幕同步
概述
2026 年春节期间,小红书社交业务在亿级 DAU 流量洪峰下落地「语音拜年」与「表情烟花」两大活动,其中语音拜年的技术链路为「语音识别 → 字幕渲染 → 动效编排」:语音识别能力基于小红书 Super Intelligence-AudioLab 团队自研的 FireRedASR2S 构建,该系统集成静音检测、语种检测、语音识别、标点恢复等模块,支持多语种及 20+ 中文方言,能处理多种声学场景并输出多维标签的结构化结果,针对性应对方言口音(覆盖 20+ 地域方言)、耳语与中英夹杂等表达习惯、鞭炮声与家庭聚会噪声干扰、以及从旗舰机到入门机的麦克风差异。 识别结果驱动祝福字幕逐字浮现并与烟花粒子动效同步播放,音画同步调度偏差需控制在毫秒级。上线结果由正文给出:实时交互系统触达成功率 99.9%,其间 Predy 动效引擎加载成功率 99.8%、动画播放成功率 99.6%,加载量级破亿且 CNY 活动期间无稳定性问题与线上客诉。首帧渲染耗时 P95 小于 220ms,音画同步偏差 P95 小于 50ms。 智能渲染调度下 81% 设备运行于 High 等级、18% 平滑降级至中低等级。语音拜年用户参与度与累计发送量超预期,相当比例来自沉默关系或新建立的陌生关系。