论文
VibeSearchBench:野外长期主动搜索基准测试
VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
摘要
基于 LLM 的代理在搜索基准上得分很高,但真实用户始终发现结果不满意,揭示了持续的评估体验差距。我们将这种差距归因于现有基准对过度指定的查询、单轮交互和固定模式评估的依赖,这些都没有反映用户和代理通过多轮对话协作完善模糊意图的真实搜索行为。我们将这种范式命名为 VibeSearch 并引入 VibeSearchBench,这是一个基准测试,包含 20 个领域的 200 个手动策划的双语(中文和英文)任务,分为 VibeSearch-Pro(专业)和 VibeSearch-Daily(日常生活)子集。每个任务将用户角色与无模式 真值 知识图配对,并通过渐进式披露用户模拟器和图匹配评估框架进行评估。我们在 ReAct 框架和 OpenClaw 代理工具下对七个前沿模型进行了基准测试。结果表明,所有模型对于 VibeSearch 来说仍然远远不够(最佳 F1:30.30),这凸显了在长上下文推理、主动意图引发和结构化知识构建方面取得根本性进展的必要性。