论文
短视频平台上的Living-Screen-Native GUI智能体的基准测试
Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms
摘要
GUI智能体 今天呈现一个静态屏幕,其中世界被冻结在两个动作之间。然而,诸如短视频应用程序之类的真实界面违反了这一假设,因为它们的内容会不断播放,而有能力的用户必须决定观看什么内容以及观看多长时间。我们将此任务正式化为 Living-Screen-Native GUI智能体,并引入 LivingScreen,这是第一个在短视频平台上实例化该任务的基准测试,具有可靠的基于浏览器的环境、三层任务套件以及联合评估准确性和信息效率的指标。通过评估广泛的前沿模型,我们发现没有一个模型能够达到人类的成本准确性性能,并且它们的主要故障模式是观察过度和观察不足,这表明观察控制是未来 GUI智能体 缺失的能力轴。所有数据和代码均可在 https://github.com/BITHLP/LivingScreen 上获取。