论文

实时助理:了解是否、何时以及向谁在现实世界的实时社交流中提供协助

Live Assistant: Learning Whether, When, and Whom to Assist in Real-World Live Social Streams

模型训练强化学习

摘要

直播是持久的交互环境,其中视听内容、观众活动、主持人行为和平台信号共同发展,从而产生了直播本身产生的帮助需求。我们引入了 \liveassistant,一个混合主动、角色条件协助的框架,它将直播互动制定为四个耦合决策:\textbf{是否行动、何时行动、向谁讲话以及沟通什么}。每 10 秒间隔,一个自回归策略会使用带有同步评论、礼物、观看者动态和房间元数据的原生音频和视频,然后选择 \textsc{OBS}、\textsc{MEM} 或 \textsc{ANS}。 \textsc{OBS} 保持沉默,\textsc{MEM} 记录私有语义更新,\textsc{ANS} 指定收件人、任务和基于当前场景的消息。为了支持这项任务,我们构建了一个轨迹引擎,将真实的直播会话重建为结构化因果监督,产生超过 320 小时的优化轨迹以及由 275 个剪辑和 13,812 个决策间隔组成的人工审查基准。我们使用标记感知多圈监督微调(MA-MSFT)来训练策略,该方法增强了稀疏结构化决策,然后是流式多圈 GSPO(SM-GSPO),该方法利用回合和轨迹级信用来优化自生成轨迹。在坚持的基准测试中,\liveassistant 达到了 71.14 的状态准确度、72.67 的接收准确度和 58.41 的任务准确度,与代表性流媒体和一般多模态基线相比具有一致的增益。制定、基准和训练框架共同将直播援助确立为选择性参与共享社交流。