论文
思维简写:通过熵引导超级词元压缩 LLM 推理
Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens
摘要
大语言模型 中的推理需要大量的推理时间计算,但推理轨迹的 词元级 信息结构仍未得到充分探索。我们观察到推理标记分为两种功能类型:低熵结构标记(支撑推理过程的重复短语)和高熵有机标记(推动解决方案的特定问题内容)。这种不对称性激发了一种简单的、与模型无关的压缩管道:在模型自己的推理轨迹上应用跨词 BPE 合并,以导出捕获频繁结构模式的 \textit{supertokens},然后通过监督 微调 教导模型采用它们。在三个模型系列和五个数学推理基准中,我们的方法平均将推理轨迹缩短了 8.1%;在 +/- 2pp 裕度的 TOST 等价分析下,13/15 模型 - 基准单元(2 次通过等效,11 次不确定,主要是 N=30 时的 AIME,2/15 单元上的非等效降级(MATH-500 和 OlympiadBench 上的 DeepSeek-R1-Distill-Llama-70B)的精度是等效的或不确定的。除了压缩之外,学习的超级词元通常与可解释的推理动作(例如回溯、验证和策略转变)保持一致,这可以对推理轨迹进行紧凑的结构分析:正确的轨迹显示更多的恢复和验证模式,而错误的轨迹则显示更多的重复对冲和未解决的反驳。我们将完整的管道作为开源代码发布。