论文
一维有序词元支持高效测试时搜索
(1D) Ordered Tokens Enable Efficient Test-Time Search
摘要
标记化是自回归 (AR) 生成模型的关键组成部分,可将原始数据转换为更易于管理的建模单元。通常,标记描述局部信息,例如图像中的像素区域或文本中的单词片段,并且 AR 生成以固定顺序预测这些标记。一个有价值的问题是,词元结构是否会影响通过测试时搜索引导生成的能力,其中验证者会探索和评估多个候选生成。使用图像生成作为我们的测试平台,我们假设最近具有从粗到细结构的一维有序分词器比经典的二维网格结构更适合搜索。这是因为从粗到细的序列中的中间状态带有验证者可以可靠评估的语义,从而在生成过程中实现有效的引导。通过受控实验,我们发现与基于网格的模型相比,在从粗到细的有序标记上训练的 AR 模型表现出改进的测试时间缩放行为。此外,我们证明,由于有序结构,在图像文本验证器的指导下,对词元序列的纯测试时搜索(即不训练 AR 模型)可以执行 无需训练 文本到图像的生成。除此之外,我们系统地研究经典搜索算法(Best-of-N、beam search、lookahead search)如何与不同的 token 结构交互,以及不同验证者和 AR 先验的作用。我们的结果强调了词元结构对推理时间可扩展性的影响,并为 AR 模型中的测试时间扩展提供了实用指导。