论文

衡量规范决定的内容:正式的语义块模型和执行判断基准

Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark

模型评测评测方法与指标

摘要

这项工作引入了规范的正式语义块模型和执行判断的基准,用于独立于模型功能评估规范质量。规范被表示为一种结构,包括语义块、依赖关系、块拥有的规则、决策点和显式开放的问题,并服从四个机器可检查的格式良好的条件:非循环性、单一所有权、约束支配以及总体性或模糊性停止。确定性在模型理论上被定义为所有一致实现之间的一致性,并通过独立实现者之间的收敛进行经验估计。该模型根据包含 18 个块和 19 个依赖边的 Oracle 到 PostgreSQL 迁移规范进行实例化。计算验证表明,五层分解通过依赖闭包将每个任务的平均上下文减少了大约 71%,覆盖了研究定义的 Oracle 构造分类的 85.5%,并对所有已识别的间隙进行了分类,不是由测试的替代分区帕累托主导,并且从不用于定义原始结构的引文衍生边缘恢复到第 99.9 个百分位数。该基准测试保持实施者面板固定,包括强制的无规范控制臂,并使用 PostgreSQL 16 和实时 Oracle 实例作为确定性执行判断。六项设计研究,包括三项预先注册的操作和三项诊断分析,进一步检验了规范效应。对 25 个单位子样本的重复运行揭示了经验变异性下限,中位臂增量分布为 14.4 个百分点。结果支持确定性作为一个正式概念,但不作为被评估的当代 LLM 实施者的独立经验质量指标。