论文

小语言模型的代码引导推理:评估可执行的 MCQA 支架

Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds

模型评测评测方法与指标

摘要

多项选择 QA 基准通常将小语言模型 (SLM) 评估为直接应答器,但已部署的语言模型系统越来越依赖于外部支架,例如工具、代码和重复的模型调用。我们引入了代码引导推理 (CGR),这是一种评估协议和生成程序资源,用于测量可执行推理支架何时提高 MCQA 任务上的 SLM 性能。 CGR 标准化了六个组件:标准化项目接口、直接求解器提示、生成器提示、Python 支架、求解器调用和提取帮助程序以及三通道结果记录。在来自本地准备的 MCQA 包和六个元数据注册求解器模型的 20,498 个保留结果行上,观察到的非零基线分区显示宏辅助精度为 66.21%,而直接精度为 38.11%,与 [20.32, 36.43] 的配对引导区间相差 +28.10 个百分点。在更严格的 Ab > 30% 直接信号门下,宏观差异为 +14.11 点。这些估计是描述性的。辅助推理使用更大的求解器调用预算,答案提取很脆弱,Time-MQA 包含观察到的回归,并且某些生成的程序违反了非硬编码指令。 CGR 提供解释这些结果所需的跟踪包,包括直接、辅助和生成器端答案、分区定义、生成的程序、响应元数据和审计。