论文
SyntaxBench:字符级推理的统计诊断框架
SyntaxBench: A Statistical Diagnostic Framework for Character-Level Reasoning in Large Language Models
摘要
大语言模型日益用于小语法错误也很重要的场景,但字符级推理仍主要通过孤立探针与聚合准确率评估。我们提出SyntaxBench——字符级推理的诊断基准与统计评估框架:含五个核心任务(字符计数、字母包含、回文检测、编辑距离、最长字符串选择)加index_to_span(更难的子串抽取压力测试)。五个核心任务使用配对的英文与字符长度匹配的随机串输入;index_to_span文档共享200-500词带、不做字符长度匹配。六任务均用零/一/四样本提示。我们跨11种推理模式配置评估八个2B-32B开放权重模型;框架报告精确匹配与宽松准确率、Cohen kappa、配对McNemar检验与优势比、bootstrap置信区间、Kendall tau、类条件指标、token化分析与多重比较校正检验。三个发现突出:其一,token化塑造准确率——随机串比英文字符更可见(每token 1.892对3.169字符),字符计数准确率随英文词占用更多token而下降;其二,推理模式并非普遍有益——Gemma4-31B在近饱和任务上跨模式几乎不变,而Qwen3.6-27B在回文检测上带思考更差(四样本0.952不思考对0.886思考);其三,index_to_span基本未解——最佳四样本精确匹配准确率仅6.75%。字符级评估需要受控输入、配对检验及对token化与推理模式的分析,而非仅聚合准确率。