技术实践

Descript 重构翻译配音流水线,规模化生成多语言视频配音

应用与实践内容创作

概述

Descript 是一款以改文字即改视频为理念的 AI 原生视频编辑器,长期在转写环节使用 Whisper、在协作编辑器 Underlord 中使用 GPT 系列模型。视频翻译配音成为高价值场景后,团队重做了翻译流水线:先按句子边界、自然停顿和说话习惯把文稿切块,再让模型计算音节数,结合各语言语速假设估算译文的目标音节量,同时优化时长贴合与语义保留,并把相邻块作为上下文传入以保持连贯。OpenAI 官网案例称,上线后首30天带配音的翻译视频导出量增加15%,时长贴合度按语言不同提升13至43个百分点,落在可接受语速区间的片段占比从40%–60%升至73%–83%;为保语速付出语义取舍后,仍有85.5%的片段在语义贴合上获四五分评分。团队通过真人试听、逐级调速打分来制定评测验收标准,并表示正为语义保真要求更高的场景增加调校控制。