论文

猎鹰感知

Falcon Perception

模型架构Transformer

摘要

以感知为中心的系统通常使用模块化编码器-解码器管道来实现:用于特征提取的视觉主干和用于任务预测的单独解码器(或后期融合模块)。这就提出了一个核心问题:这种架构分离是否必要,或者单个早期融合堆栈是否可以大规模进行感知和任务建模?我们引入了 Falcon Perception,这是一个统一的密集 Transformer,它从第一层开始在共享参数空间中处理图像补丁和文本标记,使用混合注意模式(图像标记之间的双向,预测标记的因果关系)将全局视觉上下文与自回归、可变长度实例生成相结合。为了保持密集输出的实用性,Falcon Perception 保留了轻量级词元接口,并使用专用头对连续空间输出进行解码,从而实现并行高分辨率掩模预测。我们的设计提倡简单性:我们保留一个可扩展的主干,并将复杂性转向数据和训练信号,仅在输出连续且密集的地方添加小头。在 SA-Co 上,Falcon Perception 将掩模质量提高至 68.0 Macro-F$_1$,而 SAM3 为 62.3。我们还引入了 PBench,这是一个针对组合提示(OCR、空间约束、关系)和密集长上下文机制的基准,其中模型显示出更好的收益。最后,我们将相同的早期融合方法扩展到 Falcon OCR:一个紧凑的 300M 参数模型,在 olmOCR 上达到 80.3%,在 OmniDocBench 上达到 88.64。