论文

Lang2Act:通过自涌现语言工具链的细粒度视觉推理

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

模型训练强化学习

摘要

视觉检索增强生成(VRAG)通过纳入外部视觉文档来增强视觉—语言模型(VLM)以应对给定查询。现有 VRAG 框架通常依赖刚性、预定义的外部工具来扩展 VLM 的感知能力,典型做法是把视觉感知与后续推理过程显式分离。然而,这种解耦设计可能导致视觉信息的不必要损失,尤其是在应用裁剪等基于图像的操作时。本文提出 Lang2Act,通过自涌现的语言工具链实现细粒度视觉感知与推理。Lang2Act 不调用固定外部引擎,而是收集自涌现的动作作为语言工具,并利用它们增强 VLM 的视觉感知能力。为支撑这一机制,我们设计了一个两阶段强化学习(RL)训练框架。具体而言,第一阶段优化 VLM 自主探索高质量动作以构建可复用的语言工具箱,第二阶段进一步优化 VLM 有效利用这些语言工具进行下游推理。实验结果证明了 Lang2Act 在显著增强 VLM 视觉感知能力方面的有效性,性能提升超过4%。所有代码与数据见 https://github.com/NEUIR/Lang2Act。

Lang2Act:通过自涌现语言工具链的细粒度视觉推理
图2:Lang2Act 总体架构概览。