论文
Agent4POI:多模式兴趣点推荐的代理上下文条件可供性推理
Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation
摘要
我们引入了 Agent4POI,这是第一个 POI 推荐框架,它在推荐时生成上下文条件的多模态表示,而不是依赖于独立于上下文预先计算的静态 POI 嵌入。现有的多模式系统将每个 POI 编码为静态嵌入一次,这种设计无法推理为什么同一家咖啡馆在周一提供单独工作,但在周五晚上提供集体庆祝活动。我们正式证明,没有预先计算的编码器可以满足标准双线性评分下的上下文相关排名,从而激发推理时间项目侧表示。 Agent4POI 反转了这种计算:给定情境上下文,四阶段 LLM 代理生成动态的、特定于上下文的可供性查询(第 1 阶段),并针对图像、评论和元数据证据执行五步跨模式思维链(第 2 阶段)。由此产生的不确定性可供性表示以吉布森可供性理论为基础。这些跨模态判决形成了结构化的、经过不确定性调整的可供性表示(第 3 阶段),它通过用于低延迟排名的语义缓存系统与用户偏好保持一致(第 4 阶段)。在三个 POI 基准和三种评估配置(标准、冷启动、上下文转换)上,Agent4POI 比最强基线实现了 23.2% 的相对增益,并且在上下文转换下仅下降了 7.5%,而最强基线则下降了 16--17\%。在冷启动场景中,Agent4POI 的性能比基于内容的最佳基线高出 2.4 倍,而基于 ID 的方法则无法泛化。