论文
xDailyBench:面向真实生活问题的专业咨询评测
xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems
摘要
大型语言模型 (LLM) 越来越多地用于日常帮助,但现有基准仅部分反映用户在实践中自然提出的请求。现实世界的请求通常是开放式的、随意指定的并且依赖于上下文,要求模型不仅要遵循明确的指令,还要从用户背景和情境上下文中推断出未声明的需求。我们推出了 xDailyBench,这是一个由 248 项精心策划的任务组成的基准,涵盖个人生活、白领工作、学习和研究以及跨领域活动的 51 个场景。这些任务基于用户实际完成或真正打算使用人工智能完成的请求,并使用涵盖显式和隐式要求的细粒度二进制标准进行评估。我们在标准化智能体设置下评估了 11 个前沿模型。最好的模型取得了 75.6% 的任务级分数,而所有模型在隐性要求上的表现都比显性要求差很多,差距不少于 9 个百分点。这些结果表明,隐式需求推断是可靠地满足现实世界的日常用户需求的持续瓶颈。