论文
HyperBrowseComp:网页浏览智能体的多语言多模态压力测试
HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents
摘要
我们提出HyperBrowseComp——多语言多模态浏览基准:423道人工撰写并经人类验证的问题横跨13种语言,由母语或高熟练者撰写。问题设计得极其困难:每个问题指向一个简洁、可公开验证的答案,其发现需要定位隐匿证据、追踪多步线索链或检视视频、扫描文档、图像或地图等异构来源。更容易的问题通过与无网模型评估被过滤,以降低仅凭参数知识作答的可能。我们在共同智能体协议下用厂商原生搜索与共享外部检索Harness评估多个模型;为给模型表现与努力提供语境,还对问题样本进行了人类评估。HyperBrowseComp为跨语言与证据模态的持续信息搜寻提供挑战性试验床,难度来自在开放网络上发现并连接证据。