论文

ASIL:用结构化状态与语义动作取代截图点击

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions

智能体系统模型训练强化学习智能体互操作协议Agentic RLMCP

摘要

强大的代码智能体能执行脚本、调用工具和管理文件,但许多重要应用仍主要只能通过图形用户界面访问。我们认为,对软件操作智能体而言,截图加点击是一种低效接口:截图状态不完整,GUI动作脆弱、语义贫弱,且与长程规划不匹配。我们提出ASIL(Agent-Software Interaction Layer),一种智能体原生接口,通过结构化JSON观察和可代码执行的语义动作暴露软件,并为每个应用采用可行的最深访问路径来实现。我们在15个应用以及包含300个单应用任务和80个多应用任务的基准上实例化ASIL。ASIL在闭源模型下达到80分以上,同时每个任务执行的动作少于五个。在修复的运行时和50步截图预算下,同样的任务在截图点击对照下分别取得6.6和26.6的严格成功率,在更易的与OSWorld可比的档位上提升到15.0和53.3。在匹配任务上与应用原生接口对比,ASIL超过LibreOffice的UNO API 28-38个严格分点,但仅与draw.io的MCP内容契约持平。这种结构化模态也适合训练:小规模SFT将Qwen3.5-2B从58.0提升到72.1、Qwen3.5-9B从66.6提升到80.4,资源受限的on-policy RL进一步将两者提升到74.4和82.2。

ASIL:用结构化状态与语义动作取代截图点击:论文配图
图1:ASIL 概览。传统 GUI 智能体将软件操作绑定在人类本色的截图-点击循环上,需要在局部像素表面上进行视觉定位并依赖脆弱的动作序列。ASIL 用对软件状态的结构化观测和可由代码执行的语义动作取代这一界面,通过文件、脚本和服务级访问路径实现,覆盖 15 个软件环境和 380 个基准任务。