Hydra:在单一视觉语言模型中统一文档检索和生成
Hydra: Unifying Document Retrieval and Generation in a Single Vision-Language Model
摘要
视觉文档理解通常需要单独的检索和生成模型,从而使内存和系统复杂性加倍。我们提出了 Hydra,一种双头方法,它提供了 ColBERT 风格的后期交互检索和来自单一视觉语言模型的自回归生成。仅针对检索进行训练的单个 LoRA 适配器在推理时进行切换:使其能够产生多向量嵌入;禁用它可以恢复基本模型的生成质量,426 个语言模型权重张量中的 426 个与新加载的 Qwen3.5-4B 逐字节相同。我们确定了两种故障模式,它们可以悄悄地破坏检索微调 VLM 中的生成(注意力模式恢复和 lm_head 保存)以及效率要求(KV 缓存感知解码); Hydra 在结构上回避了前两个问题,并在解码循环中解决了第三个问题。我们发布了两个规模 Hydra-4B 和 Hydra-0.8B,共享 LoRA 超参数(r=32,alpha=32)和优化配方;数据混合和投影暗淡在不同尺度上有所不同。相对于共存的两个模型部署,单模型设计将峰值 GPU 内存从 4B 时的 28.85 GB 削减至 10.77 GB(减少 62.7%),将峰值 GPU 内存从 5.79 GB 削减至 0.8B 时的 2.37 GB(减少 59.1%)。受控消融发现 GritLM 式联合训练与 Hydra 在评估模式上的仅检索训练相匹配,而其 LoRA-on 生成模式崩溃了。 Qwen2.5-Omni-3B 上的概念验证保留了非 Qwen3.5 主干上的生成等效性,并在 Hydra-4B 的 2-8 pp 内传输图像检索,并通过冻结的 Whisper 编码器出现零样本音频检索。