论文

RetailSMV:零售业基础视频世界模型的外中心与第一人称适应

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

模型训练参数高效训练

摘要

基础视频传播模型越来越被视为实体代理的世界模拟器,但它们对互联网规模通用视频的预训练使它们与现实世界的部署领域不太相符。我们研究预训练基础视频世界模型对零售场景的参数高效适应:当同一活动的同步第一人称和外中心视频可用时,哪种训练数据观点会产生最强的适应模型?我们引入了 RetailSMV(零售同步多视图),这是一个由来自 5 家超市的 32,105 个带字幕的零售剪辑组成的语料库,从商店员工的角度同步自我/外在捕获(备货、安排、称重、管理供应车、结账时扫描),而不是之前零售视频语料库以客户为中心的框架,并训练了三种匹配的 Cosmos3-Nano 低秩适应 (LoRA) 配置(仅第一人称、仅外中心、组合)在相同的超参数下。在严格配对统计协议下使用七个互补指标评估的 200 个剪辑保留测试集上,仅第三人称适应在七个点估计中的六个上匹配或超过组合适应,并且在 LPIPS、PSNR 和 DreamSim 上明显更好,尽管仅使用 15,985 个第三人称剪辑进行训练(相对于组合的 32,105 个剪辑)。对称配对比较进一步表明,将第三人称数据添加到仅以自我为中心的训练中会有所帮助,而将第一人称数据添加到仅第三人称训练中会带来伤害。绝对适应差距在最短的预测时长内最大,将短时域预测窗口确定为适应最有利的制度。