论文

智能体-计算机观察接口使能动态计算机使用

Agent-Computer Observation Interfaces Enable Dynamic Computer Use

智能体系统Agent Harness

摘要

SWE-agent确立动作接口为软件工程智能体未被充分探索的设计轴;我们为计算机使用(CU)智能体的观察接口做类似论证。当前CU智能体——闭源与开源皆然——把观察绑到动作:每3-5秒一张截图、无音频——使其在截图间对视频、动画、瞬态UI事件、会议与口语指令又盲又聋。我们介绍智能体-计算机观察接口(AOI)——模型无关感知层——经三个门控组件把连续自适应观察与离散动作解耦:步间关键帧捕获、音量门控音频转录——以及CU模型生成的、以文本持久化的视觉叙述。每个组件在静态无声内容上几乎不产出——退化为标准循环而不劣化它。在DynaCU-Bench(100个动态浏览器任务加50任务静态对照)上——从7B到前沿规模的CU模型较其截图基线零重训练增益+17到+48个百分点——把从周期性截图近乎不可能的任务变为大体可解。差距在音频上最显著:在口语内容子集上AOI智能体解出全部任务——而流式语音模型听得准却无法在没有脚手架时对所听内容行动。分解与总体增益同样有信息量:关键帧选择原来不重要——价值来自把捕获帧叙述为持久文本——且该接口不是固定捆绑——在更新的模型(Gemini 3 Flash)上关键帧流经图像token稀释反而倒退——因此其组件必须按模型选择而非作为单一配置交付。