论文

SegCompass:探索与稀疏自动编码器的可解释对齐以增强推理分割

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

模型架构新型架构

摘要

虽然 大语言模型 提供强大的组合推理,但现有的推理分割管道无法透明地将这种推理与视觉感知联系起来。当前的方法,例如潜在查询对齐,是端到端但不透明的“黑匣子”。相反,文本本地化读出只是可读的,而不是真正可解释的,通常充当不受约束的事后步骤。为了弥补这种可解释性差距,我们提出了 SegCompass,这是一种端到端模型,利用稀疏自动编码器(SAE)来打造显式、可解释和可微分的对齐路径。给定图像指令对,SegCompass 首先生成一条思路 (CoT) 跟踪。我们方法的核心是 SAE,它将 CoT 和视觉标记映射到共享的高维稀疏概念空间。查询码本从该空间中选择显着概念,然后由时隙映射器在空间上将其空间定位到指导最终掩模解码器的多时隙热图中。整个模型是联合训练的,将推理路径的强化学习与标准分割监督相结合。这种 SAE 驱动的界面提供了一种“白盒”连接,该连接比潜在查询更容易追踪,并且比文本读出更连贯。对五个具有挑战性的基准进行的广泛实验表明,SegCompass 匹配或超越了最先进的性能。至关重要的是,我们的视觉和定量分析显示了所学习的稀疏概念的质量与最终掩模精度之间的紧密相关性,证实了 SegCompass 通过其增强且可检查的对齐实现了卓越的结果。代码可在 https://github.com/ZhenyuLU-Heliodore/SegCompass 获取。