论文

RecoAtlas:LLM 推荐代理中从语义合理性到集合级实用性

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

智能体系统Agent任务评测

摘要

LLM 推荐代理越来越多地生成结构化推荐报告:带有自然语言理由的项目集。然而,现有的评估通常会将这种设置简化为对小型入围候选集进行重新排名或主要通过语义合理性来判断报告。我们引入了Recommendation Atlas(购物代理工具级评估)或RecoAtlas,这是一个基准和工具包,用于使用基于行为的指标评估购物代理。 RecoAtlas 通过从交互数据中获得的相关性、互补性和多样性的学习效用代理来补充保留的交互指标,同时单独测量语义连贯性和解释质量。其受控工具环境使代理接触语义、行为一致或错误的工具,从而能够诊断性能增益是否来自更强的推理、更好的信号或更有效的工具使用策略。通过受控实验,我们表明 RecoAtlas 展示了代理系统有意义的基准的关键属性:性能随模型容量和测试时计算而扩展,通过更强大和更好对齐的工具进行改进,在噪声或未对齐的信号下降低性能,并揭示语义合理性不一定捕获基于行为的效用。 RecoAtlas 为开发和评估购物助理提供了基础,不仅可以优化合理的推荐,还可以优化连贯的、基于行为的推荐集。