论文

TTE-Flash:通过Think-Then-Embed词元加速基于推理的多模态表示

TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens

模型推理推理加速

摘要

近期研究表明,通用多模态嵌入(Universal Multimodal Embedding,UME)能从思维链(Chain-of-Thought,CoT)推理中显著获益。在该范式中,生成模型为多模态查询产生显式推理轨迹,最终表示则从一个同时关注查询与推理的<eos>嵌入词元中提取。尽管有效,生成显式CoT轨迹的计算开销常常高得令人望而却步。在本工作中,我们提出用潜在think词元替代显式CoT:这些词元被解释为潜变量,显式CoT轨迹则作为观测变量由其产生。通过用CoT生成损失优化think词元、用对比损失优化随后的嵌入词元,我们在恒定的推理成本下获得高性能、推理感知的表示。我们的研究考察了两个关键架构设计:1)think词元与嵌入词元应如何从同一LLM骨干中提取;2)这两类词元应如何作为两个相互依赖的任务进行训练。我们推出TTE-Flash-2B,一个推理感知的多模态表示模型,它在MMEB-v2基准上超越其显式CoT对应版本,同时产生的潜在think词元在文本和视觉上均可解释。此外,跨15个视频数据集的零样本评估揭示了随think词元数量增加而呈现的缩放规律,并启发了一项基于任务需求自适应分配think预算的试点研究。

TTE-Flash:通过Think-Then-Embed词元加速基于推理的多模态表示:论文配图
(a) 循环架构自动回归生成下一个隐藏状态以进行推理和嵌入。(b) 寄存器是与提示一起编码为单个预填充过程的特殊标记。图 1:Think-Then-Embed 标记的循环方法和基于寄存器的方法的比较。