论文
Pixelis:像素推理,从观看到行动
Pixelis: Reasoning in Pixels, from Seeing to Acting
摘要
大多数视觉语言系统都是静态观察者:它们描述像素,不行动,并且不能在转移下安全地改进。这种被动性限制了普遍化的、基于物理的视觉智能。通过行动而不是静态描述来学习比整理数据更重要。我们提出 Pixelis,一种像素空间代理,它通过一组紧凑的可执行操作(缩放/裁剪、分割、跟踪、OCR、时间定位)直接对图像和视频进行操作,并从其结果中学习。 Pixelis 分三个阶段进行训练:(1) 受监督的 微调 从思想行动链跟踪中学习像素工具语法,并使用屏蔽模仿损失来增加操作/论证标记和辅助头的权重,以稳定基于像素的论证; (2) 好奇心-连贯性奖励 微调 优化了双驱动目标,将预测误差好奇心与相邻步骤连贯性和 KL 锚点下的温和先验效率相结合,产生简短、有效、结构化的工具链; (3) 像素测试时间 RL 通过检索邻居、对完整轨迹而不是答案进行投票、更新短的、高保真样本,同时通过 KL 到 EMA 安全控制来限制漂移,从而执行无标签适应。在六个公共图像和视频基准测试中,Pixelis 取得了一致的改进:与相同 8B 基线相比,平均相对增益为 +4.08%(在 VSI-Bench 上峰值为 +6.03%),计算为(我们的基线)/基线,同时生成更短、可审核的工具链,并在测试时学习期间保持走廊内 KL。在像素内而不是抽象符号内行动,奠定了物理世界中多模态感知的基础,将视觉推理与可操作的结果联系起来,并在没有外部反馈的情况下实现了具身适应。