论文
Ko-WideSearch:韩国广度搜索基准,用于通过网络代理进行详尽的集枚举
Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents
摘要
网络代理基准测试主要衡量深度——将一个晦涩的答案固定在一系列约束后面——而广度,详尽地枚举一个封闭的集合并填充每个项目的属性,几乎没有被评估,特别是在英语之外。广度也很难建立:证明标准答案集合是完整的并且每个单元格都正确比检查单个答案要昂贵得多。我介绍了 \textsc{Ko-WideSearch},这是一个由自动合成和验证管道构建的韩国广度搜索基准。每个任务都会命名一个父实体——一个电视季、一个王朝、一个联赛、一个行政区域、一次选举——并要求其完整成员资格以及按项目、列和行 F1 分级的每项目属性表。它跨越 190 个实体和 16 个类别的 228 个表格,跨越三个难度级别,由我独立拨动的两个结构旋钮(表格宽度和二维复合键)设置,因此跨产品会员资格在各个级别上从 0\% 攀升至 100\%。黄金构建和分级之间共享单个标准化感知比较器,因此稳定的日期和计数列不会在单独格式化时过度下降。在 20 个网络代理中,失败是一致的:代理恢复了集合,但没有恢复行(例如,Item-F1 92.8 与 Row-F1 53.7),随着旋钮变硬,准确性稳步下降,更多的搜索和更多的支出都无法缩小差距。按单元格细分,最困难的部分是找到正确的值,而不是对其进行格式化:开放式自由文本单元格最容易失败,而具有标准答案(例如日期或名称)的单元格通常会正确显示。