论文

SPARK:易感性引导的LLM潜推理状态画像与转向

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

模型推理推理验证与自校正

摘要

大语言模型(LLM)的推理失败通常从最终答案评估,但错误答案不能揭示模型为何失败。同样的错误输出可能反映能力缺失、不稳定的推理轨迹、或未能激活冻结模型中已有的推理状态。既有提示与基准评估方法多在输出层运作,而通用的激活转向方法通常施加全局方向、不诊断哪些样例需要干预。本文提出SPARK:用隐状态响应诊断模型是否在内部进入有效推理状态,并引导轻量的测试时转向。关键观察是:原始隐状态易感性被提示长度强烈混淆——尤其在程序化与算法推理中,更难的序列化实例天然更长。SPARK因此使用长度控制的易感性把输入规模效应与残余推理激活分开,并把该信号与跨层协调结合,选出推理活跃的锚点与激活不足的困难样例。我们以FRONTIER-4.5K作为受控程序化推理套件做潜画像与难度感知分析,并在GSM8K与MATH-500上以前向基准画像评估SPARK转向:方法持续改善Qwen3系列模型——MATH-500上Qwen3-4B准确率从82.0%升至84.6%、Qwen3-8B从82.4%升至85.6%。结果表明易感性不仅可作为推理失败的诊断信号,也可作为定向测试时干预的实用指南。

SPARK:易感性引导的LLM潜推理状态画像与转向:论文配图
图 1:SPARK 的动机和概述。基准评估观察正确和错误的答案,并用准确度曲线总结性能,但隐藏潜在的推理状态。 SPARK 通过潜在分析和测试时指导补充了这种输出级视图。它诊断隐藏状态响应,选择推理活跃的锚点和未激活的硬目标,并评估转向是否可以改善更困难的示例,同时保留更简单的情况。