论文
当你不告诉LLM该想什么时,它们在想什么?
What LLMs Think When You Don't Tell Them What to Think About?
摘要
刻画大语言模型(LLMs)在多样设定下的行为,对可靠的监控与AI安全至关重要。然而,大多数现有分析依赖特定主题或特定任务的提示,这会大幅限制可观察到的内容。在这项工作中,我们研究LLM从极简的、主题中性的输入中生成什么,并探查其近乎无约束的生成行为。尽管没有任何明确的主题,模型输出仍覆盖广泛的语义空间,而且令人惊讶的是,每个模型家族都表现出强烈而系统的主题偏好。GPT-OSS主要生成编程(27.1%)和数学内容(24.6%),而Llama最常生成文学内容(9.1%)。DeepSeek经常生成宗教内容,Qwen则频繁生成选择题。除主题偏好之外,我们还观察到内容专门化与深度上的差异:与其他模型(如基础Python)相比,GPT-OSS常生成技术上更进阶的内容(如动态规划)。此外,我们发现近乎无约束的生成常常退化为重复短语,揭示出各模型家族独有的有趣行为。例如,Llama的退化输出包含多个指向个人Facebook和Instagram账号的URL。我们发布了来自16个LLM的256,000个样本的完整数据集,以及一个可复现的代码库。
