论文

PANDO:经由在线技能蒸馏的高效多模态AI智能体

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

智能体系统Agent Skills

摘要

多模态网络智能体的最新进展常常依赖增加推理时计算,包括rollout搜索、验证器多轮、离线技能发现与专家模型堆栈。这引出一个核心问题:网络智能体能否随着经验积累变得更高效,而不是更昂贵?我们首先分析VisualWebArena的轨迹,识别出三种反复出现的低效来源:重复动作循环、隐藏的发现成本与低提示缓存复用。随后我们提出PANDO,一个单次rollout的在线技能蒸馏框架,维护结构化技能库(Skill Library),并结合进度反思、基于置信度的技能降级、分层路由、视觉压缩与缓存感知提示。在VisualWebArena全部910个任务上,PANDO取得58.3%的成功率,超过SGV(54.0%)和我们的WALT复现(45.2%),同时比SGV少用58%、比WALT少用61%的词元,且不需要任何预评估发现预算。300任务的消融进一步表明,规则与例程贡献了大部分成功率收益,而路由、压缩与缓存感知提示将更大的技能库转化为更低的边际词元成本。最后,我们提出三个轨迹级效率指标——动作重复率、步骤开销比与提示缓存利用率——使效率在最终成功之外变得可见。

PANDO:经由在线技能蒸馏的高效多模态AI智能体:论文配图
图 1:PANDO 架构。规划器将任务分解为子目标;技能选择器从结构化技能库中检索规则和例程;无与伦比的子目标落在行动者身上;反射器验证进度并检测重复;学习模块执行在线蒸馏、极性对合并、置信度更新和降级。正式的详细信息和文件架构位于 App 中。一个。