论文

通过扩散 Transformer 进行生成检索,并采用度量有序序列训练和混合策略偏好优化

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

摘要

基于嵌入的检索根据项目与共享向量空间中的查询的相似性对项目进行排名,通常旨在返回得分最高的项目。在许多生产环境中,这并不是我们想要的:给定一个表达细粒度模式的种子集,需要更多既满足目标属性又保持在该模式内的项目。我们将其形式化为模式保留属性检索。这两个目标相互矛盾:对种子进行平均可以保留模式,但保留在低属性区域,而全局属性检索则漂移到不相关的模式。我们通过连续生成检索来处理该任务,其中模型读取一系列项目嵌入并生成用于最近邻搜索的查询嵌入。我们提出了 MO-DiT+HPPO,这是一种具有原始序列预训练、多域度量有序连续预训练、尾部质心 微调 和 HPPO 的分阶段框架。度量排序训练将稀疏的在线检索标签转变为按预测属性密度从低到高排序的模式内轨迹,从而向模型传授跨域的度量改进方向。 HPPO 通过使用在线交集度量标记混合候选池并应用参考锚定偏好优化,将生成的查询分布与真实的在线目标对齐。帕累托对过滤器仅保留不会降低相同模式纯度的获胜对,从而在不牺牲模式的情况下提高属性度量。在项目和模式保留协议下的四个属性域中,度量排序的 DiT 改进了预训练生成 检索器 的交集度量,HPPO 进一步改进了它,在八个域分割单元中的七个上获得了显着收益,并且在最难的分割上取得了边际平局。指标预测器验证、顺序消融、CPT/SFT 比较以及候选策略消融显示了收益的来源。