论文
ReasonOps:LLM推理轨迹的算子切分
ReasonOps: Operator Segmentation for LLM Reasoning Traces
摘要
大型推理模型的思维链轨迹可绵延数万token,但我们缺少描述其内部结构的词汇体系。以往为分析思维链轨迹而开发的方法要么过于僵化,要么表达能力不足,无法跨领域、跨模型地捕捉特征。为弥补这一不足,我们开发了ReasonOps,一种无监督且富有表达力的思维链轨迹标注方法,提供简洁的通用算子。利用ReasonOps,我们分析了来自6个家族12个思维型LLM、覆盖8个推理基准的44,662条轨迹,发现它们共享一个共同的组合结构:7个反复出现的推理算子——回溯、推断、假设等话语层动作——它们从句首3-token枢轴的无监督聚类中浮现。这些算子出现在所有模型家族和基准领域中,并由三个独立的LLM评判者确认,它们对留出样本的分类准确率为70-76%。我们分析了算子在简单与困难问题上的结构,发现反思型算子在困难问题上更有帮助,而在简单问题上损害表现。算子序列具有很强的模型辨识力:仅用算子分布训练的分类器就能以macro-AUC识别出源模型,这表明每个模型家族都有独特的推理指纹。结构化算子特征对问题内答案正确性的预测能力远高于基线。基于这些算子构建的分类器达到了WP-AUC,在AIME上尤为突出。ReasonOps还能在轨迹远未完成时进行早期质量估计:仅用轨迹的50%即可达到WP-AUC水平的预测。ReasonOps流水线无监督且免标注,既能深入洞察LLM推理轨迹,也在模型识别和正确性预测上取得强劲的下游结果。
