论文
从模仿到歧视:稳健的网络导航的渐进式课程学习
From Imitation to Discrimination: Progressive Curriculum Learning for Robust Web Navigation
摘要
基于文本的 Web 代理为自主 Web 导航提供了计算效率,但由于现实世界 HTML 的噪声和异构性质,开发强大的代理仍然具有挑战性。标准监督 微调 (SFT) 方法在两个关键方面失败:它们缺乏辨别能力来拒绝人口稠密的页面中看似合理但不正确的元素,并且对看不见的网站布局表现出有限的泛化能力。为了应对这些挑战,我们引入了 Triton 数据集(59 万个实例)和渐进式训练课程。 Triton 是通过结构语义硬负挖掘(显式挖掘拓扑相似的干扰项)和双代理共识管道(通过严格验证综合不同的跨域任务)构建的。在此基础上,我们的渐进式课程产生了三个模型:用于基本模仿的 Triton-SFT-32B、通过优势比偏好优化实现稳健区分的 Triton-ORPO-32B、通过组相对策略优化实现长期一致性的 Triton-GRPO-32B。 Mind2Web 上的实证评估表明,Triton-GRPO-32B 以 58.7% 的步进成功率在开源模型中实现了最先进的性能,超过 GPT-4.5 (42.4%) 和 Claude-4.5 (41.4%) 16% 以上,验证了专门的数据课程胜过网络导航的原始参数规模。