论文
V-LynX:视频+X LLM 的词元接口对齐
V-LynX: Token Interface Alignment for Video+X LLMs
摘要
这项研究在 Video LLM 中引入了一个有趣的现象:Video LLM 不只是将帧转换为文本嵌入,而是建立了一个连续的流形词元接口,允许视觉词元作为架构内的独立实体运行。利用这一发现,我们提出了 V-LynX,这是一个可扩展的框架,通过重新调整内部接口的用途,将新颖的模式集成到视频 LLM 中。与需要重型模态特定编码器或配对监督的传统范例不同,V-LynX 采用与冻结视觉编码器并行的轻量级辅助路径。我们的方法通过使用不成对的单峰数据集对齐注意力响应和统计分布,将新的感官输入与内在视频先验相结合。这确保了多种兼容性,同时保留了视频 LLM 的完整性。广泛的基准测试表明,V-LynX 在视听 QA、3D 推理、高帧率和多视图视频理解方面实现了 SOTA 和效率。该代码可在 https://github.com/park-jungin/lynx 获取。