论文
响应缺乏理解:揭示视觉文档理解中的内部表征和响应之间的差距
Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding
摘要
视觉文档理解 (VDU) 对于大型视觉语言模型 (LVLM) 来说是一项具有挑战性的任务,需要集成视觉感知、文本识别和结构化布局推理。尽管最近的 LVLM 在 VDU 基准测试上取得了进展,但它们的性能通常是根据生成的响应进行评估的,这可能不一定反映模型是否实际上在内部捕获了所需的信息。在本文中,我们研究了如何使用线性探测在 LVLM 内的 LLM 的不同层上表示解决 VDU 任务所需的信息。我们的研究表明,(1)内部表示和生成的响应之间存在明显的差距,(2)解决任务所需的信息通常从中间层比从最终层更线性地编码。受这些发现的启发,我们探索了针对中间层的 微调 策略。实验表明,微调 中间层在缩小差距的同时提高了线性探测精度和响应精度。