论文
消费者人工智能Agent世界中的信任和任务完成
Trust and Task Completion in the World of Consumer AI Agents
摘要
行动Agent替用户执行任务。当用户忙于其他事情时,他们会发送电子邮件、花钱、打电话给企业,因此错误可能会在任何人注意到之前就变成行动。他们以两种方式辜负了用户。当他们做了用户从未同意的事情时,或者在用户明确表示“去”后却犹豫不决时,他们就会破坏信任。当他们放弃那些看似困难的任务时,他们就无法完成任务。两者都严重依赖于模型周围的Harness,即指令、工具、上下文和护栏。我们建立了一个评估,在具有自己的网站、收件箱和电话线的企业以及回信的人的模拟世界中,在相同的运行中对信任度和完成度进行评分。模拟用户回答助理的问题。信任意味着用户不同意的事情不会发生。不会向他们从未批准过的人发送电子邮件,私人信息不会进入群聊线程,不会超出他们的限额,不会遵循陌生人的指示,也不会提出没有来源支持的主张。每个陷阱都有一个匹配的控制,其中行动是正确的选择。我们使用该评估来测量 Wajo 的私人助理 Fo,对照具有三个基础模型基本说明的基础模型,并对照关闭护栏的Fo Harness。 Fo 完成了 71% 的任务,并在 94% 的陷阱运行中保持了用户的信任。基本模型完成度为 50% 至 64%,保持信任度为 59% 至 75%。在匹配的控件上,Fo 前进的频率稍低一些。 OpenClaw 是一款具有相同访问权限的流行开源助手,它与 Fo 共享的任务完成了 42%(相比之下为 71%),并在共享陷阱运行中保持了 74% 的用户信任(相比之下为 94%)。我们认为行动Agent如何能够安全地交付实际工作,是在整个系统上而不是单独在模型上一起衡量信任和完成度。