论文
TLive-Omni:面向电商直播的全模态理解模型
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
摘要
电商直播需要对嘈杂、时间延展的流进行全模态理解,其中产品事实分布在语音、视频帧、商品图片、叠加文字与用户提问之中。我们提出TLive-Omni,一个为直播电商场景量身定制的全模态理解模型。它把图像、视频、音频与文本输入映射到统一表示空间。针对长时直播分析,我们提出Per-vGrid,一种带时间戳的词元组织方式,把每个视频网格与其时间上对应的音频在显式边界词元内编组,以促进时间对齐。我们设计三阶段监督训练配方,从全模态感知到指令遵循响应,渐进发展直播电商理解。随后我们提出Faithful-RFT,一个强化微调阶段,在满足实时性要求的同时进一步提升答案忠实度与表达质量,直接用任务可验证反馈对最终响应打分,而非在rollout期间优化推理风格的探索。此外,TLive-Omni由一个面向场景的原子能力分类法和一个紧凑的数据生产引擎支撑,后者把直播电商的音频、图像与视频流转为语音识别、说话人分析、商品视觉定位、文字识别、时间定位、视频密集描述与全模态问答等任务的训练信号。为支持可扩展训练,同步的按长度分组采样器在保持各工作进程负载相当的同时减少填充,轻量动态采样策略则以近零奖励方差重新生成rollout组,为GRPO维持有意义的相对优势。在电商直播基准上的实验显示,该模型在直播电商领域任务上表现强劲,并在通用基准上具备出色的泛化。
