论文

掷骰子方法:大语言模型 品牌推荐重复查询审核的标准化协议

The Dice Roll Method: A Standardized Protocol for Repeated-Query Auditing of Large Language Model Brand Recommendations

模型评测评测方法与指标

摘要

背景:研究人员越来越多地使用重复的相同提示来审核 大语言模型 (LLM) 品牌推荐中的随机变化,但不存在用于设置迭代计数、选择稳定性指标或建立可靠性阈值的标准化协议。目标:我们将掷骰子方法形式化为一种可重复使用的协议,用于对 LLM 品牌建议进行重复查询审核,该协议基于温度缩放核采样的生成模型。方法:总响应方差被分解为抽样、提示措辞、运行间和模型版本部分。堆栈:负二项式混合模型,以迭代作为重复测量; Cliff's delta 作为无分布效应大小;保持依赖的引导程序;基于模拟的电源;泛化理论分解;对固定快照进行漂移诊断。我们重新分析了五项品牌推荐审核研究:大约 190,000 个观察结果、270 多个品牌、6 种语言、迭代计数 5 到 40。结果:D 研究中出现了三层迭代指导:探索性(n = 5,G = 0.58)、验证性(n = 10,G = 0.74)和严格性(n = 15,G = 0.81),与效果大小和普遍性目标相关。四个指标系列(计数、集合、嵌入、公平调整 PASOR)是互补的,在单个指标上激发了紧凑的指标电池。对三个独立语料库(Motoki 等人,100 轮;Rozado,24 个模型;LLM-稳定性)进行的预注册外部验证在 39 个单元中的 37 个单元中重现了 D 研究可靠性预测,没有出现故障,n = 5 的幂值精确到两位小数;固定层不会转移,支持先试验后解决的阅读方式。结论:该协议在真实自回归生成的条件、非高斯结构下为 LLM 品牌推荐的重复查询审核提供了统计原则基础。