论文

PeopleSearchBench:用于评估人工智能驱动的人物搜索平台的多维基准

PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms

模型评测评测方法与指标

摘要

人工智能驱动的人才搜索平台越来越多地用于招聘、销售勘探和专业网络,但尚无广泛接受的基准来评估其绩效。我们推出 PeopleSearchBench,这是一个开源基准测试,它比较了四个人物搜索平台在四个用例中的 119 个真实查询:企业招聘、B2B 销售勘探、具有确定性答案的专家搜索以及影响者/KOL 发现。一个关键贡献是基于标准的验证,这是一个事实相关性管道,它从每个查询中提取明确的、可验证的标准,并使用实时网络搜索来确定返回的人是否满足这些标准。这产生了基于事实验证的二元相关性判断,而不是主观整体大语言模型作为判断分数。我们从三个维度评估系统:相关性精度(填充的 nDCG@10)、有效覆盖率(任务完成情况和合格结果产量)和信息效用(配置文件完整性和有用性),平均分为总分。 Lessie 是一款专门的人工智能人员搜索代理,整体表现最好,得分为 65.2,比排名第二的系统高出 18.5%,并且是唯一一个在所有 119 个查询中实现 100% 任务完成的系统。我们还报告置信区间、验证管道的人工验证(Cohen 的 kappa = 0.84)、消融以及查询、提示和标准化程序的完整文档。代码、查询定义和聚合结果可在 GitHub 上获取。

PeopleSearchBench:基于准则校验评估AI驱动的人物搜索平台:论文配图
图1:PeopleSearchBench评测管线:在所有平台执行查询,结果归一为统一模式,再用网络搜索按抽取的核验标准独立验证每人。