论文

不可预测性与语言代理的结构化控制分离

Unpredictability dissociates from structured control in language agents

模型评测评测方法与指标

摘要

不可预测的行为通常被视为控制的证据,但随机分散和结构化行动控制不必同时发生。本文测试了随机采样是否可以替代在控制组件可以选择性禁用的语言代理实现中将原因、记忆、自我状态和抑制与动作选择相结合的结构化机制。在包含 74,352 个调用的七个数据集基线病变矩阵中,高随机性比较器比 7/7 数据集中的结构化控制变体更难以预测,而目标原因和否决病变则分别减少了 7/7 数据集中的预期结构化控制概况。在跨越 26,946 代的匹配界面控制中,结构化代理保持了比每个数据集上的所有随机、事后、混乱和冗长控制更强的动作场耦合。主要行为测试从评估中删除了自由形式的跟踪措辞:57,816 条评分记录显示,结构化控制变量超过了所有预定义行为组件的 7/7 数据集中的高随机性比较器或原因/否决损伤。后来的开放重量运行将无上下文控制扩展到 Qwen2.5 7B、14B 和 32B,以及跨 20 个任务系列和三个代理支架的独立 Mistral-7B 系列;无字段、乱序上下文和分布匹配控制无法恢复结构化动作控制。由三名注释者对 1,200 多个重叠项目进行的盲审保持了高度一致性。严格的熵匹配、严格的token/计算匹配和正式的反事实翻转压力测试未满足其要求,因此被视为限制。在这个实施的代理家族中,随机的不可预测性并没有重现结构化的、动作耦合的控制。

不可预测性与语言代理的结构化控制分离
图 1:随机色散和结构化控制迹线之间的基线分离。 a,从结构化控制变体到高随机性比较器、标准化空间中的理性损伤和否决损伤的干预向量,其轴是原始动作不可预测性以及 SCI、RSI、VEI 和 ACI 的平均值。细灰色向量显示数据集复制单位;虚线椭圆和边缘地毯显示数据集重复分布;厚标记向量显示平均位移。 b,SCI、RSI、VEI、ACI 和原始不可预测性的分量读出矩阵。颜色以度量方式报告 z z 分数;重叠的点显示数据集级别的平均值。 c,预定义基线方向的数据集级对比森林图。点是数据集单位;菱形和水平线段显示数据集单位的描述性平均值和 95% 间隔;阴影区域标志着预期的正方向。 d,签名证据条,显示每个数据集级别对比的方向和大小。