论文

LLM 中随机性的幻觉

The Illusion of Stochasticity in LLMs

模型评测模型行为与机制分析

摘要

在这项工作中,我们证明了可靠的随机采样是 大语言模型(LLM)作为代理运行的基本但尚未满足的要求。代理系统经常需要从分布中进行采样,通常是从观察到的数据推断出来的,这个过程需要由 LLM 来模拟。这导致了一个明显的失败点:虽然标准 RL 代理依赖于外部采样机制,但 LLM 无法将其内部概率估计映射到其随机输出。通过对多个模型系列、模型大小、提示风格和分布的严格实证分析,我们证明了这种失败的程度。至关重要的是,我们表明,虽然强大的前沿模型可以将提供的随机种子转换为目标分布,但它们直接从特定分布中采样的能力存在根本缺陷。