论文
视觉语言模型像人类一样搜索吗?推理token作为经典视觉搜索范式的反应时类比
Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms
摘要
视觉搜索曾是视觉注意研究最多产的范式之一:反应时随项目数的缩放方式区分并行“突现”搜索与串行、注意密集的搜索。本文追问视觉语言模型(VLM)是否展现相同的行为签名。我改编四个经典范式:特征对比合取搜索、空间构型(T对L)搜索、计数——以及倾斜/垂直搜索不对称——并呈现给当前前沿与中端模型。因为单次模型调用没有反应时——我用模型每试验花费的推理(“思考”)token数作为搜索努力的模型内类比——并对照大型公开人类基准(Wolfe等,2010)。模型复现若干人类签名:特征搜索努力平坦而合取搜索努力随集合大小攀升;前沿模型在准确率上保持而中端模型坍缩到随机;分辨率控制显示合取成本是真实搜索而非解析小形状的困难。它们也以有信息量的方式偏离人类:目标在场的努力斜率超过目标缺席——逆转人类次序;计数在人类会数错处保持准确;而一个自适应深思的推理模型干脆拒绝在检测任务上深思——以致单次搜索在一个模型中表现为努力梯度——在另一个中表现为准确率悬崖。我主张:心理物理学范式作行为应用是机器视觉认知的锋利而廉价的探针——分歧点与一致点同样有信息量。
