论文

语义流正则化:教学 LLM 生成多样化但连贯的响应

Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses

模型训练监督微调与指令调优

摘要

当 大语言模型 被微调以生成角色或音调响应时,它们的输出多样性受到严重限制 - 我们将这种失败称为“交叉风格崩溃”。我们将这种崩溃追溯到交叉熵目标,该目标在共享表示下往往会抑制不同的延续。我们提出了语义流正则化(SFR),这是一种轻量级辅助目标,通过条件流匹配通过未来片段的连续句子编码器嵌入来监督主干网。随机流源通过构造保留多模态;流匹配头在推理时被丢弃,增加了零部署成本。在大规模工业对话数据集(Qwen3-32B,9 个角色)上,SFR 比 SFT 提高了输出多样性、风格保真度和响应质量。我们在公开的 LiveCodeBench-v5 (Qwen2.5-Coder-7B-Instruct) 上进一步进行验证,其中 SFR 持续改进了 pass@k,证实了超越程式化对话的通用性。 MBPP 上的受控比较揭示了多词元预测是 SFR 的退化特例。