论文
SeerGuard:以世界模型预测守护移动GUI智能体安全
SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
摘要
移动图形用户界面(GUI)智能体在自动化复杂任务上能力突出,但也带来关键安全风险:单一错误动作可能造成不可逆后果。现有安全机制主要是被动式的,缺乏执行前评估风险的能力。我们提出SeerGuard,一个后果感知的安全框架,通过执行前的指令级筛查与动作级风险评估来缓解这些风险。动作级评估在当前GUI状态下分析智能体提出的动作、预判可能后果,在执行前识别风险。为支撑这些能力,我们以多任务学习构建统一的安全增强世界模型(SAWM),把语义下一状态预测与安全风险评估整合起来。大量实验表明SeerGuard能在多样移动GUI智能体间有效泛化:在Qwen3-VL-8B-Instruct上,ω=0.8时安全—效用分从0.191升至0.596,α=0.8时风险成本分从0.347降至0.135。对SAWM的进一步分析验证了指令级筛查的有效性,以及动作风险评估与下一状态预测的能力。
