论文

HARPO:用于用户对齐会话推荐的分层代理推理

HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation

智能体系统Agent 架构与控制循环

摘要

会话推荐系统(CRS)在增量偏好揭示下运行,需要在不确定的情况下做出推荐决策。虽然最近基于 LLM 的方法在 Recall@K 和 BLEU 等代理指标上取得了强大的性能,但它们在实践中往往无法提供高质量、用户一致的推荐,因为它们优化了中间目标,如检索准确性或流畅的生成,而不是推荐质量本身。我们提出了 HARPO(具有偏好优化的分层代理推理),这是一种代理框架,它将会话推荐重新构建为针对多维推荐质量优化的结构化决策过程。 HARPO 集成了 (i) 分层偏好学习,将推荐质量分解为可解释的维度(相关性、多样性、满意度和参与度)以及上下文相关的权重; (ii) 由学习价值网络引导的审慎树搜索推理,评估候选路径的预测质量; (iii) 通过虚拟工具操作和多代理细化进行与领域无关的推理抽象。我们对 ReDial、INSPIRED 和 MUSE 上的 HARPO 进行了评估,证明了以推荐为中心的指标相对于强大基线的持续改进,同时保持了有竞争力的响应质量。