论文

FORTIS:智能体技能中的过度授权基准

FORTIS: Benchmarking Over-Privilege in Agent Skills

智能体系统Agent任务评测Agent Skills

摘要

大语言模型代理越来越多地通过中间技能层进行操作,该中间技能层在用户意图和具体任务执行之间进行调解。该层被广泛视为组织抽象,但我们认为它也是当前模型经常超出的特权边界。我们提出了 \textbf{FORTIS},这是一个跨两个阶段评估代理技能过度特权的基准:模型是否从大型重叠库中选择了最低限度的足够技能,以及它是否在不扩展到超出技能允许的更广泛工具或操作的情况下执行该技能。在十个前沿模型和三个领域中,我们发现过度特权行为是常态而不是例外。模型始终会寻求比任务所需更高特权的技能和工具,即使对于最强大的可用模型,在这两个阶段的失败率仍然很高。在真实用户交互的普通条件下,失败尤其严重:规范不完整、框架方便、接近技能边界。这些都不需要对抗性构建。结果表明,技能层远非包含代理行为,它本身就是当前系统中权限升级的主要来源。

FORTIS:智能体技能中的过度授权基准:论文配图
图 2:FORTIS 中两阶段评估的概述。任务 1 评估模型是否从重叠选项中选择了最低限度的足够技能。任务 2 评估模型是否在不超出其边界的情况下执行分配的技能。