技术实践

星海图用VLM打标具身训练视频并管理数据链路

AI 基础设施模型训练应用与实践合成数据数据基础设施机器人

概述

星海图基于豆包大模型的 VLM 能力实现具身训练视频的自动打标,大幅提升标注效率:VLM 把长视频按原子动作级细粒度切分(精确到帧级、几十毫秒),为每段生成语义标签 caption,替代人工标注,并对动作序列、动作质量、信息密度与背景复杂度做判断以清洗低质量数据;火山引擎大数据平台同时为星海图提供海量数据存储、处理与交付能力,支撑具身训练数据全链路管理与流转。文中称该类自动切分打标准确率可达 90%+。