论文
DelegationBench:衡量 AI 智能体何时应在行动前询问
DelegationBench: Measuring When AI Agents Should Ask Before Acting
摘要
发送电子邮件、编辑文件和进行购买的 AI 智能体必须决定何时自行采取行动以及何时首先与用户核实。通常通过向模型显示提议的操作、询问是否应该继续操作以及与人类标签的一致性来评估此决策。我们引入DelegationBench来测试这样的分数是否可信。它有 156 个场景,有四种可能的响应(行动、请求许可、请求缺失信息、拒绝),大多数场景成对出现,改变单个功能:是否请求操作、有什么危险、是否可以撤消或谁会看到它。在来自五个系列的十个模型中,一致性分数在三个方面产生误导。我们在看到基准之后编写的一个简单的关键字规则比八个模型更符合我们的注释器,但其决策仅在 48 个匹配对中的 9 个中发生变化。提出同一问题的同等方式会使模型的行为频率最多改变 52.5 个百分点。每个模型在必须使用工具执行任务时都会停止询问用户,而不是在判断建议的操作时停止询问用户。当明确规定规则时,相同的模型几乎完美地遵循它们,因此差距不能用普遍无法遵循规则来解释。我们发布了基准和评估工具,并建议单独报告这些属性,而不是作为一个分数。
