论文

超越局部准确性:受控 LLM 推理评估的协议级可识别性审计

Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

模型评测评测方法与指标

摘要

即使观察协议未识别其要测量的行为属性,LLM 基准分数也可以是精确的。在受控的、基于求解器的环境中,我们对有限行为策略类进行协议级可识别性审计:给定策略 H、观察支持 O 和估计值 $τ$,我们测试 O 是否将每对具有不同的 $τ$ 分开。审计需要零模型调用并解决我们的诊断案例:仅基础观察将七个冻结的确定性策略折叠为一个等价类;完全支持产生七个类别并且没有交叉估计冲突;每个留一法支持都会保留一个建设性的碰撞见证人。根据经验,两种约束生成变体的配对有效性均为 1.0,但基本准确度和选择性响应保真度存在差异 - 在六个平衡的预言机转换方向上分别为 0.620 与 0.324(集群自举 95% CI [0.600, 0.642] 与 [0.304, 0.345]) - 并且差距在第二次重复出现确定性源(0.646 与 0.331)。审计还综合了冻结策略类的最低识别支持 ​​$O^*$:两个单元而不是完整的 36 个单元张量。这个案例展示了如何在模型推理之前从结构上检查评估设计的有效性,以及为什么基本正确性不能决定干预响应的保真度。