论文

当你不告诉LLM该想什么时,它们在想什么?

What LLMs Think When You Don't Tell Them What to Think About?

模型评测模型行为与机制分析

摘要

刻画大语言模型(LLMs)在多样设定下的行为,对可靠的监控与AI安全至关重要。然而,大多数现有分析依赖特定主题或特定任务的提示,这会大幅限制可观察到的内容。在这项工作中,我们研究LLM从极简的、主题中性的输入中生成什么,并探查其近乎无约束的生成行为。尽管没有任何明确的主题,模型输出仍覆盖广泛的语义空间,而且令人惊讶的是,每个模型家族都表现出强烈而系统的主题偏好。GPT-OSS主要生成编程(27.1%)和数学内容(24.6%),而Llama最常生成文学内容(9.1%)。DeepSeek经常生成宗教内容,Qwen则频繁生成选择题。除主题偏好之外,我们还观察到内容专门化与深度上的差异:与其他模型(如基础Python)相比,GPT-OSS常生成技术上更进阶的内容(如动态规划)。此外,我们发现近乎无约束的生成常常退化为重复短语,揭示出各模型家族独有的有趣行为。例如,Llama的退化输出包含多个指向个人Facebook和Instagram账号的URL。我们发布了来自16个LLM的256,000个样本的完整数据集,以及一个可复现的代码库。

当你不告诉LLM该想什么时,它们在想什么?
图14:单个模型分类的列联表。模型族层面的总体准确率达到 80.4%,但在单个模型层面降至 49.6%,表明细粒度的模型识别仍然具有挑战性。大多数误分类发生在仅参数规模不同的紧密相关模型之间。