技术实践

哔哩哔哩用HOMURA强化学习控制原声翻译的音节预算

模型训练应用与实践模型推理强化学习解码与生成控制机器翻译

概述

哔哩哔哩Index LLM团队披露HOMURA已大规模用于视频原声翻译。字幕和配音存在固定时间预算,通用LLM常把跨语言译文写得过长;团队以音节数作为时长代理,用Sand-Glass基准同时检查长度合规和语义保留,再通过强化学习的动态音节比例奖励调整输出长度。 该方法鼓励模型以词汇整合和句法重构提高单位音节的信息密度,而非只删除内容。原文给出与视频时间轴对齐的实际效果展示,并说明过度压缩时语义会非线性退化;中英约0.49的阈值来自指定实验,不是所有语言的固定界限。音节控制也用于Index-Homura,但本条记录实际采用和方法披露,不把旧论文EMNLP Oral消息当成新论文。旧arXiv v3正文未披露本次大规模业务采用,发布方也未给统一ROI、生产准确率或端到端语音翻译效果,相关结果不补造。