论文

K-BrowseComp:基于韩国语境的网络浏览代理基准

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

智能体系统Agent任务评测

摘要

前沿模型评估正在从基础能力(例如指令跟踪和推理)转向组合、代理能力,但韩国代理基准仍然稀缺。我们介绍 K-BrowseComp,这是一个基于韩国语境的网络浏览代理基准测试,包含 400 个问题。包含 300 个问题的 K-BrowseComp-Verified 子集由韩语母语人士手动构建和验证。在这个子集上,包括GPT-5.5、DeepSeek-V4-Pro和GLM-5.1在内的前沿LLM仅达到30.00--45.67\%,比BrowseComp大幅下降,而通过韩国专有AI基础模型计划发布的韩国LLM仅达到0.00--10.33\%。我们进一步使用困难的少样本示例和故障模式目标生成来构建 100 个问题的综合分割,以利用解决和创建 Web 浏览问题之间的不对称性。在对抗性过滤的综合诊断分裂中,最强模型仅达到 26.00\%,我们将此分裂单独报告为目标压力测试。我们公开发布我们的数据和代码。