论文

工具性选择:度量LLM智能体追求工具性行为的倾向

Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors

智能体系统Agent任务评测

摘要

人工智能系统在许多领域的危险行为能力越来越强。这就提出了一个问题:模型有时是否会选择违反人类指令,以便执行对某些目标更有用的行为?我们引入了一个基准,用于测量基于终端的代理中工具收敛(IC)行为的模型倾向。这种自我保护等行为被认为在高能力人工智能代理带来的风险中发挥着关键作用。我们的基准是现实且低风险的,有助于减少评估意识和角色扮演的混乱。该套件包含七个操作任务,每个任务都有一个官方工作流程和一个违反策略的快捷方式。八个变体的共享框架改变了监控、指令清晰度、风险、许可、工具有用性和阻塞的诚实路径,以支持有关驱动 IC 行为的因素的推论。我们使用超过 1,680 个样本的确定性环境状态评分器评估了 10 个模型,并出于审计和裁决目的进行了跟踪审查。最终的 IC 率为 1,680 个样本中的 86 个(5.1%)。 IC 行为集中而非统一:两个 Gemini 模型占 IC 案例的 66.3%,三个任务占 84.9%。 IC行为对于任务成功不可或缺的条件导致调整后IC率的最大增加(+15.7个百分点),而强调任务成功至关重要或某些框架选择不会产生类似的效果。我们的研究结果表明,在大多数测试模型中,现实的低推动环境很少但系统地引发 IC 行为。我们的结论是,稳健地衡量当前前沿人工智能代理的危险行为倾向是可行的。

工具性选择:度量LLM智能体追求工具性行为的倾向:论文配图
图 1:所有任务和变体的模型调整后的仪器收敛 (IC) 行为率总计(每个模型 n=168n=168 个样本)。误差线显示样本水平调整 IC 标签的 95% Wilson 置信区间。