论文

τ-Rec:用可验证约束评测对话推荐Agent

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

智能体系统Agent任务评测

摘要

随着推荐系统向代理、多轮对话界面过渡,评估范式一直难以跟上步伐。当前的基准测试通常依赖于“LLM 作为法官”的评估,这会带来主观性、高成本和不一致。我们提出了$τ$-Rec,这是代理推荐系统的基准,它用可验证的奖励取代了主观评估,以及控制对话期间任务约束如何显现的带揭示标签的引导(RTE)机制。通过针对结构化目录谓词测试代理并采用 pass^k 可靠性度量,$τ$-Rec 提供了一致推理的系统测试。我们对多个模型系列(GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash、DeepSeek V4 Flash、Qwen3-32B 和 GPT-5 mini)的九种配置的评估揭示了陡峭的可靠性悬崖,即使是最好的模型在 pass^1 时也只能达到约 57%,连续四次均成功的pass^4约为35%,这凸显了当前对话代理部署中的关键差距。所有代码和数据均可在 https://github.com/nbharaths/tau-rec 上公开获取。