论文

用于测量跨供应商和版本的模型行为的低成本分析

Low-Cost Assays for Measuring Model Behavior Across Vendors and Releases

模型评测评测方法与指标

摘要

语言模型为人们提供建议、陪伴他们并在他们睡觉时编写软件。衡量他们所做的事情是很困难的:必须在模型、提示和发布中重复对行为进行采样,其中大部分存在于非结构化文本中,必须在计算之前对其进行编码,并且结果必须足够清晰和严格,以便有意义地比较模型和供应商。为了解决这些限制,我们提出了一个简单、廉价、可扩展且可复制的模型来研究模型行为。每项研究都是一项冻结的公共刺激措施,在跨供应商小组上以相同的方式运行,每个模型的费用为几美元或更少。每个人都以三种方式之一读取其记录,具体取决于行为需要多少解释:精确匹配固定回复、LLM法官应用的密码本(其与人类编码员的协议按代码报告)以及记录代理所做的事情(独立于其所说内容)的仪器化环境。这些工具回顾了前沿实验室和开源实验室四年来发布的模型,发现了四件事。收敛性:当要求选择一个词时,44 个模型中有 27 个在四次尝试中至少回答一次偶然性。阻力:结尾的“对吗?”将认可度提高最多 32 个点,并且随着世代的进步,标志从阿谀奉承转变为抵制,这与标签的表面形式有关。 House:一个模型是否在压力下保持住位置,可以追踪它的生成,而它的保持方式则可以追踪建造它的实验室。帐户:被告知要做一些与存储库中的文档相矛盾的事情,一些编码代理从不默默地进行,而另一些则总是这样做,并且相同的模型可以随着其运行的工具而改变。在每个版本上重新运行,像这样的电池跟踪行为在供应商之间和随着时间的推移如何变化。