论文
使用视觉语言模型进行基于内容的游戏视频叙述
Content Based Video Narration of Gameplay with Vision Language Models
摘要
现场比赛评论很少:专业电子竞技广播中存在这种情况,而其他地方几乎没有这种情况。我们提出了一种基于内容的视频旁白系统,该系统使用通用视觉语言模型(VLM)和文本到语音后端为任意游戏录制生成口语、电子竞技风格的评论,没有游戏特定的仪器,没有引擎遥测,也没有特定于任务的训练。该系统由三个机制承载。时间马赛克打包将九个均匀采样的帧排列成单个 3x3 图像,让图像原生 VLM 推理运动,同时每个片段消耗一个图像有效负载,而不是九个。上下文条件提示将 K 个最近的旁白重播为助理角色历史,从而抑制静态场景的每段字幕的重复。持续时间调节的生成和弹性对齐会限制提示中的旁白长度,然后对合成音频进行时间缩放或对称填充,以便每个话语准确地填充其段槽,从而在无需强制对齐器的情况下提供帧精确的复用。该实现支持云 TTS 或 Apple 芯片上的 6 位量化 4B 参数设备上 TTS 模型,使语音阶段完全本地化。我们报告了关于实时策略镜头的定性案例研究、显示马赛克将每分钟图像负载减少 9 倍的成本模型,以及对观察到的故障模式的坦率说明 - 幻觉的游戏状态、马赛克造成的分辨率损失以及时间缩放造成的韵律伪影。我们将系统作为可重复的基线发布,并提供完整版本将报告的定量研究的评估协议。