论文
MOBA-VL:用于实时 MOBA 评论的事件本地化多轮强化学习
MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary
摘要
多人在线竞技 (MOBA) 电子竞技的实时解说需要视觉语言模型 (VLM) 来流畅、准确地逐秒解说现场比赛。现有的流式 VLM 听起来很自然,但经常错过关键事件,例如击杀和目标。为了解决这个限制,我们使用游戏遥测技术来准确记录每个事件发生的时间,作为监督信号。我们引入了 MOBA-VL,这是一种 9B 参数模型,通过事件局部多回合强化学习对此信号进行训练,该模型奖励描述每个事件的回合。我们还收集了 MOBACast、三款 MOBA 游戏中的 860 场职业比赛(约 460 小时)以及带时间戳的文字级评论,以及 MOBACast-Bench(举办锦标赛的基准)。在 MOBACast-Bench 上,MOBA-VL 在完整比赛(StreamingVLM 为 63.25 比 55.12)和剪辑(DeepSeek-V4.1-Flash 为 63.45 比 56.22)上取得了最高的总分。与监督微调相比,事件本地化信用也将事件召回率从 34.5 提高到 42.1。代码和数据将被发布,并且可以在匿名项目页面 https://moba-vl.github.io. 上获得演示