论文
LoHoSearch 用知识图谱扩大长程搜索评测难度
LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling
摘要
以BrowseComp为代表的搜索Agent基准在过去一年迅速趋于饱和,最强模型准确率已超过90%。这些基准主要由人工编写,标注者缺乏实体统计的全局视角,难以系统扩大搜索空间和结构复杂度,形成难以突破的难度上限。我们提出LoHoSearch,包含11个领域的544道经人工验证的高难度问题。其自动构建流程基于覆盖超过700万个维基百科实体的知识图谱,选择搜索空间大的关系,组合成结构复杂的问题,并通过知识图谱验证答案唯一性。评估显示,最强模型准确率也仅为34.74%;现有上下文管理策略的最佳提升为6.8%,明显小于在过去基准上的收益。LoHoSearch为搜索Agent的长程推理及上下文管理提供更严格的评估标准。