论文
DocOS:迈向GUI智能体中的主动文档引导行动
DocOS: Towards Proactive Document-Guided Actions in GUI Agents
摘要
尽管图形用户界面(GUI)智能体在自动化设备交互中展现出令人瞩目的性能,它们主要依赖预训练或指令微调获得的静态参数化知识。这种依赖从根本上限制了它们处理需要显式程序性知识而模型参数中并不具备的长尾任务的能力,往往迫使智能体诉诸低效且脆弱的试错探索。为缓解这一局限,我们针对动态开放网络环境中的GUI智能体提出主动文档引导行动,这一新范式模拟人类解决问题的过程,让智能体自主搜索相关文档来解决长尾任务。为评估智能体在该范式下的能力,我们提出DocOS,一个旨在评估完全交互环境中文档引导问题求解能力的基准。DocOS要求智能体自主操作网页浏览器、定位相关在线文档、理解程序性指令,并将其忠实地落地为可执行的GUI操作。大量实验表明,进展受到双重瓶颈的严格制约:智能体难以在主动搜索中可靠地定位相关信息,且经常无法将检索到的指令忠实地转化为精确操作,这表明文档引导交互是让GUI智能体在动态环境中实现自我进化的关键路径。
