论文
最后的指纹:Markdown 训练如何塑造 LLM 散文
The Last Fingerprint: How Markdown Training Shapes LLM Prose
摘要
大语言模型 以不同的速率产生长破折号,并且某些模型“过度使用”它们的观察结果已成为人工智能生成文本最广泛讨论的标记之一。然而,这种模式不存在机械解释,并且 LLM 默认为 markdown 格式输出的并行观察从未与之相关。我们认为,em 破折号是 Markdown 渗透到散文中的——LLM 从 Markdown 饱和训练语料库中获得的结构方向的最小幸存单元。我们提出了一个五步谱系,连接训练数据组成、结构内化、em dash 的双语域状态和 后训练 放大。我们通过来自 5 个提供商(Anthropic、OpenAI、Meta、Google、DeepSeek)的 12 个模型进行两种条件抑制实验来测试这一点:当模型被指示避免 Markdown 格式时,明显的特征(标题、项目符号、粗体)被消除或几乎消除,但破折号仍然存在——除了 Meta 的 Llama 模型,它根本不产生任何效果。 Em dash 频率和抑制阻力从每 1,000 个字 0.0(Llama)到 9.1(抑制下的 GPT-4.1)变化,充当所应用的特定 微调 程序的签名。三条件抑制梯度表明,即使是明确的 em dash 禁止也无法消除某些模型中的伪影,并且基础与指令的比较证实了 RLHF 之前存在潜在趋势。这些发现将两个先前孤立的在线讨论联系起来,并将破折号频率重新定义为 微调 方法论的诊断,而不是文体缺陷。