论文
行动胜于雄辩:衡量工具使用代理的跨语言政策保留情况
Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
摘要
当使用工具的智能体被赋予不同语言的相同任务时,它是否仍然采取相同的步骤?多语言评估很少询问:它比较最终答案并丢弃操作。然而,这些操作是产品:它们修复成本和延迟,决定系统如何失败,并且是其行为的唯一可审计部分。我们将行动策略作为跨 8 个模型、6 个并行基准和 41 种语言(238 万条执行轨迹)的测量对象。这种幼稚的测量失败了:原始痕迹相似性和任何可辩护的主张之间存在五个混淆,每个混淆都可能推翻结论。短痕迹得分较高,空痕迹得分完美,不相关的痕迹在一半以上的时间里偶然一致,差距受到每个模型的可重复性的限制,模型用一种语言两次问同一问题,答案不同,不留下基线。我们删除了所有五个,并且每次修正都会使效果更大。发散证明是结构性的,而不是采样噪声:它能够在每个单元中的贪婪解码中幸存下来,并且随着温度升高而保持平坦,即使模型变得越来越不自洽。通过其自身的可重复性进行归一化,四个截然不同的前沿模型在贪婪解码下收敛,每个模型跨语言保留 71-73% 的动作策略,模型身份仅解释 5.7% 的方差。低于大约 10B 参数,它会崩溃,并且较小模型之间的排序很大程度上是我们通过排列而不是假设来测量的机会底线的产物。座席通过英语路由非英语任务;这个枢轴是因果承载的,由四个模型的预先注册预测证实,模型不会在被告知时放弃它。最后,单个跟踪提取正则表达式(而不是模型)造成了多语言失败:两个有效示例将一个模型的测量精度提高了 26 倍,而其可读输出的精度几乎没有变化。