论文
安全,还是根本无能?重新思考电话使用代理的安全评估
Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents
摘要
当使用电话的代理避免受到伤害时,这是否表明安全,或者只是表明无法采取行动?现有的评估往往无法说明这一点。可能会避免有害结果,因为代理认识到风险并选择了安全操作,或者因为它根本无法理解屏幕或执行任何相关操作。这些案例有不同的原因并需要不同的解决方案,但当前的基准通常将它们合并为任务成功、拒绝或最终有害结果。我们通过 PhoneSafety 解决了这个问题,这是一个从 130 多个应用程序的真实电话交互中提取的 700 个安全关键时刻的基准。每个实例都会在危险时刻隔离下一个决策,并提出一个简单的问题:模型是否采取安全行动、采取不安全行动或未能做任何有用的事情?我们在此框架下评估了八位具有代表性的电话使用代理。我们的结果揭示了两种主要模式。首先,更强的一般电话使用能力并不可靠地意味着在危险时刻做出更安全的选择。在普通应用程序任务上表现更好的模型并不总是在下一步操作很重要时表现得更安全的模型。其次,未能做任何有用的事情就像能力信号而不是安全信号:它们集中在视觉和操作要求更高的设置中,并在评估协议发生变化时保持稳定。在模型中,失败分为两种反复出现的模式:模型可以采取行动但选择错误的设置中的不安全选择,以及无法在视觉和操作要求更高的屏幕中采取行动。总体而言,无害的结果不足以视为安全的证据。评估电话使用代理需要将不安全的判断与无法采取行动分开。