论文
准确率更好、推理更糟:医疗思维链蒸馏的步骤级审计
Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation
摘要
思维链(CoT)蒸馏训练一个较小的模型去模仿教师的推理轨迹,但通常用包括准确率在内的最终答案指标来评估。我们追问:答案质量的提升是否伴随推理轨迹的改善。在医疗问答中,简短的答案选项可能使更丰富的临床论证无从落实,从DeepSeek-V3系教师蒸馏而来的Qwen3-8B学生在MedQA-USMLE答案指标上有所提升(SC@64从74.7%升至84.4%;期望校准误差(ECE)从0.096降至0.034)。然而在Kimi-K2.6风格盲评LLM裁判的审计下,其非弃权步骤的错误率从30.6%升至50.3%。在这一主要医疗场景中,答案质量与轨迹事实性朝相反方向移动。这种前后对比模式在不同评估器、教师强度、学生规模与系列、医疗基准以及风格、分段与答案正确性对照下持续存在。一位临床专家开展的150步盲评审计复现了同样的排序。边界检查收窄了该论断的适用范围:当简短的答案对论证约束不足,而能力较强的学生又能在未可靠锚定每个局部论断的情况下模仿出专家式形式时,风险便会出现。标准答案指标与总体对冲率都无法揭示这一转变。当此类轨迹被发布或复用时,仅凭答案层级的指标是不够的。