论文
MAG:多模态动作与引导生成的网页智能体基准与治控
MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation
摘要
数字采用平台(DAP)是广泛嵌入网页系统的覆盖层:引导用户完成页内操作,帮助其快速上手陌生界面。但完成真实任务很少意味着在单页上点几个按钮:它需要一串跨页面状态变化的动作序列。既往研究还把网页智能体动作与引导文本生成当作两个独立问题,且多数给模型的是DOM或无障碍树等文本页面表示,而非人类实际操作的渲染屏幕。本工作提出MAG:首个把任务执行与引导写作统一为单一“多模态动作与引导”任务的基准,在截图上支持两种落地方式——Set-of-Mark元素选择与原始像素坐标。我们进一步为该复合任务构建完整治控:覆盖LLM辅助加人工核验的标注、训练、真实环境评估、以及动作与引导的联合指标。以该治控评估前沿API模型与开放多模态模型并给出细致分析。最后,我们设计经专家轨迹增强的GRPO训练方法:把监督训练的9B智能体成功率近乎翻倍(6.9%到13.2%),同时提升引导质量。即便最强模型完成任务也不足40%,为后续研究留下充足空间。
