论文

K²-Agent:面向分层移动设备控制的陈述性与程序性知识协同演化

K^2-Agent: Co-Evolving Know-What and Know-How for Hierarchical Mobile Device Control

智能体系统模型训练上下文与知识强化学习记忆Agent 架构与控制循环Agent SkillsRLVRAgentic RLAgent记忆

摘要

现有移动设备控制智能体在解决需要长时程规划和精确操作的复杂任务时常常表现不佳,通常由于缺乏相关任务经验或对技能执行不熟悉。我们提出K2-Agent,一个分层框架,通过分离并协同演化用于规划与执行的陈述性知识(知道什么)与程序性知识(知道如何做)来模拟人类认知。K2-Agent的高层推理器从每个任务的单条演示引导启动,运行Summarize-Reflect-Locate-Revise(SRLR)循环,通过自演化蒸馏并迭代精炼任务级陈述性知识。低层执行器用课程引导的群组相对策略优化(C-GRPO)训练,它(i)使用解耦的奖励信号构建均衡样本池,(ii)采用动态演示注入引导模型自主生成成功轨迹用于训练。在具有挑战性的AndroidWorld基准上,K2-Agent仅使用原始截图和开源骨干模型就取得76.1%的成功率。此外,K2-Agent展现出强大的双重泛化能力:其高层陈述性知识可跨不同基座模型迁移,而其低层程序性技能在ScreenSpot-v2和Android-in-the-Wild(AitW)的未见任务上取得有竞争力的表现。

K²-Agent:面向分层移动设备控制的陈述性与程序性知识协同演化
图7:K²-Agent 框架的认知启发。该设计将人类对陈述性知识(“知道什么”)与程序性知识(“知道怎么做”)的区分映射到分层智能体架构上。