论文

LLM品牌回答的波动来源:非确定性的方差分解

Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers

模型评测评测方法与指标

摘要

衡量 大语言模型 (LLM) 是否推荐某个品牌的团队面临着可重复性问题:问同一个问题两次,答案就会发生变化。通常对每个提示重新采样几次(通常为五次)并取平均值,将提示内重新采样视为噪声源。但衡量的品牌得分的变化至少有四个独立的原因:提示内重采样、提示改写、模型标识和查询语言。我们指定交叉随机效应(概化理论)分解,将响应级别品牌结果的总方差划分为这四个来源,并将这些组件嵌入到决策研究分配中,该分配返回为实现目标可靠性而购买的重复次数、释义、模型和语言数量。我们将其应用于 20 个中欧和东欧品牌、8 种语言和 3 个模型(参数模式下的 GPT-5.2 和 Gemini 3 Flash,有来源依据的检索中的 Perplexity)的 12,933 个 LLM 响应的完全交叉语料库,其中 1,435 个单元格的稳定性子集重新采样了大约五次。结果是每个响应的多语言情感极性。查询语言是最大的系统方面(一个响应的方差为 26.5%),而品牌标识为 1.5%(ICC 0.0146),因此单个人工智能答案几乎不带有品牌辨别信号。一旦单元术语分离出纯重采样,重采样的方差为 34.8%,品牌与上下文的交互为 29.6%;按品牌划分的语言为 8.6%(双语惩罚),而按品牌划分的模型和按品牌划分的提示则接近于零。对于每单位的查询预算,添加语言和模型所减少的相对误差方差远大于添加重复:超过第五次的重复仅将其减少 0.0003。品牌排名的可靠性仍然很低,单个答案接近 0.01,全交叉设计约为 0.36,因此可靠性是通过跨语言和模型传播来获得的,而不是通过重复一个提示来获得。