论文
诊断形式几何中的LLM推理样本:覆盖范围、实现和有效性证据
Diagnosing Sampled LLM Reasoning in Formal Geometry: Coverage, Realization, and Validity Evidence
摘要
重复采样可以揭示正确的数值答案,但不会产生可靠的系统输出或受支持的推导。我们提出了覆盖率、实现和有效性证据(CRV),这是一种针对形式几何状态的采样大语言模型(LLM)推理的评估协议。覆盖范围是答案的可用性,实现是冻结候选池上的读出准确性,有效性证据是对推导支持的标签盲批评判断,而不是证明证书。 CRV 在比较读数之前冻结每个候选池,并通过正确答案多重性和问题内歧视来分析涵盖的失败。在 HardShift441 上,参考求解器有 406 个问题未解决,有 441 个问题集,采用 LoRA 的 Qwen2.5-7B 生成器获得了 24.2% 的平均单样本精度和 68.9% pass@16,而验证者加权自一致性 (WSC) 达到 38.0%。当正确答案在池中仅出现一次或两次时,读出精度特别低。在对 195 个涵盖问题进行的单独构建审核中,评论家将 12 个正确答案代表标记为支持,181 个标记为驳斥,还有 2 个标记为不确定。这些结果表明,批评者的覆盖范围、实现和有效性证据是不同的数量,应该单独报告。