开源项目FlashVID:免训练时空Token合并视频模型开源Fanziyang-v/FlashVIDFanziyang-v·来源日期:2026.01.29模型推理推理加速收藏概述FlashVID是高效视频大语言模型的官方实现,核心方法是通过免训练的树状时空Token合并降低视频理解的计算开销,面向视频理解研究与应用开发者。项目采用MIT许可,1月30日发布两类模型代码与演示,1月31日首次公开仓库,提供安装、推理及评测流程。由于合并在推理阶段完成、不涉及重新训练,已有模型可以按论文方法直接套用,用于控制长视频输入的开销。