论文

HF-SID:用于基于位置的服务中的生成检索的高保真语义 ID

HF-SID: High-Fidelity Semantic IDs for Generative Retrieval in Location-Based Services

模型训练预训练

摘要

生成式检索在基于位置的服务 (LBS) 中引起了越来越多的关注,其中每个兴趣点 (POI) 都表示为语义 ID (SID)。由于 SID 是 POI 信息到达生成模型的唯一通道,因此无论它未能保留什么,在解码时都是无法恢复的,并且 LBS 检索对现有 SID 模糊的细粒度差异特别敏感。具体来说,(1)LLM不连续地嵌入连续坐标,因此它们的数值差异不能反映真实的地理距离; (2) 动态数值属性在规模上差异很大,因此相同的差距对于一个属性可能是决定性的,而对于另一个属性则可以忽略不计; (3) 短文本无法传达层级关系,因为文本相似的 POI 可能属于不同的层级。因此,我们提出 HF-SID,它在任何信息被提交到离散代码之前在表示阶段恢复地理、数字和结构保真度。它将坐标转换为连续的 3D 笛卡尔形式,并将每个数值编码为单个单元,通过具有类型感知嵌入的 Geo-CPT 和 Num-CPT 合并在 LLM 内;基于结构的对比学习目标,仅应用于最后一层残差,然后分离共享粗略标签但在精细级别上不同的共定位 POI。由于这些机制丰富了表示而不是延长了标识符,因此 HF-SID 使用 3 词元 SID,无需额外的解码成本。在大规模工业数据集上,它使 SID 内的平均地理距离缩短了 95.9%,并将 Hit@200 比最强基线提高了 3.66 个点,在线 A/B 增益为 +6.74% PV_CVR 和 +6.03% UV_CVR。我们进一步发布了大规模真实 POI 数据集 AMap-S。