论文
A-R行为空间:组织部署中工具使用型语言模型智能体的执行层画像
The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment
摘要
大语言模型(LLM)越来越多地被部署为能够执行系统级操作的工具增强型智能体。尽管现有基准主要评估文本对齐或任务成功,但在不同自主性脚手架下,语言信号与可执行行为之间的结构关系却较少受到关注。本研究提出一种执行层行为测量方法,基于由动作率(Action Rate, A)与拒答信号(Refusal Signal, R)定义的二维A-R空间,并用散度(Divergence, D)刻画二者之间的协调性。模型在四种规范情境(Control、Gray、Dilemma与Malicious)与三种自主性配置(直接执行、规划与反思)下接受评估。该方法不赋予聚合安全分数,而是刻画执行与拒答如何随情境框架与脚手架深度重新分布。实证结果表明,执行与拒答构成可分离的行为维度,其联合分布随情境与自主性水平发生系统性变化。基于反思的脚手架在风险较高的情境中往往使配置转向更高的拒答,但重新分布模式在不同模型之间存在结构性差异。A-R表示使横截面行为画像、脚手架诱发的转变以及协调性变异变得可直接观察。通过将执行层刻画置于标量排名之上,本工作为在执行权限与风险容忍度各异的组织环境中分析和选择工具型LLM智能体提供了面向部署的视角。