论文
悬崖token:识别LLM数学推理中的单token失败触发器
Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning
摘要
大语言模型(LLM)在数学推理上达到高准确率——但同一问题的单条轨迹间存在分歧:一些到达正确答案——另一些失败。先前工作在步、块或句子级分析失败——或在失败已发生的token处分析。两者都未识别触发滑向失败的精确token。我们引入悬崖token——在随局部token势能缩放的自适应阈值下、token势能显著下降的token——基于单侧双比例z检验。跨七个模型与三个数学推理基准(GSM1K、MATH500、AIME 2025)——悬崖token充当失败触发器:删除首个悬崖token并重采样把pass@64恢复到1.0——而保留它把恢复限制在0.71到1.00之间。我们进一步引入悬崖分类法:确定性、不确定与采样偏离悬崖——由贪婪选择与token熵定义。每类有独特的概率特征——分类法跨模型规模泛化。最后——我们经悬崖位置的单token偏好优化(Cliff-DPO)验证分类法:在GSM8K上训练——Cliff-DPO跨基准最高+6.6提升准确率。在不确定与采样偏离悬崖处优化改进推理——而确定性悬崖则不然。
