论文

度量语言模型智能体的跨任务行为一致性

Measuring Cross-Task Behavioral Consistency in Language Model Agents

模型评测评测方法与指标

摘要

智能体评估几乎完全依赖成功率等结果指标,它们能捕捉智能体是否成功,却无法捕捉其行为的一致程度。我们认为跨任务行为一致性是一种独立且可度量的属性,并引入行为一致性度量(BCM)来量化它。BCM训练一个模型从智能体执行轨迹的行为特征预测任务成功,导出每条轨迹的特征归因向量,并度量一个智能体系统内这些向量的平均两两相似度。在来自六个语言模型智能体、约9,000条软件工程任务轨迹上,我们的核心发现是跨任务一致性与任务内一致性是可能背离的两个独立轴:一些系统在局部可复现——对同一任务的重复尝试行为相似——却在全局上碎片化,在不同任务间没有稳定策略;另一些则在两个尺度上都一致。以往工作只度量同任务可复现性,因此无法观察到这种分离。我们进一步发现一致性不能还原为成功率,因为成功率相当的系统在一致性上可能差别悬殊;并且在控制任务难度的任务内对照下,前沿模型与开源模型之间的一致性差距依然存在。我们将BCM定位为补充结果指标的过程级可靠性信号,并明确说明其在何种条件下才有意义。

度量语言模型智能体的跨任务行为一致性:论文配图
图3:轨迹归因向量的二维 UMAP 投影,按行为原型着色(k=3)。前沿系统集中在果断执行者簇中(上方);开源 Llama 系统分布在全部三个簇中,主导原型因任务实例而异。