论文

DepthBenchCAD:更深入的审核何时会产生更可靠的结论?

DepthBenchCAD: When Does Deeper Auditing Yield More Reliable Conclusions?

模型评测评测方法与指标

摘要

生成 CAD 模型在参数编辑后应保持行为正确,因此增加编辑检查的数量通常被视为获得更可靠评估的直接途径。然而,在固定预算下,更彻底地审核每个程序会减少可评估的任务和独立生成的数量,这最终会降低模型级估计的准确性。我们研究这种现象及其产生的条件。我们将行为评估分解为三个证据级别:任务模板、随机生成和程序内编辑。我们定义了与审计深度无关的平均失败风险,并将三级方差与测量的执行成本相结合,以分析更深层次的编辑审计和更广泛的独立覆盖范围之间的权衡。跨两个 CAD 环境和五代系统的实验表明,更深入审核的价值取决于评估不确定性的来源。当模板异质性或生成随机性占主导地位时,额外的编辑检查可能会增加总估计误差;当程序内状态变化很大且生成成本昂贵时,更深入的审核更有价值。校准的方差和成本估计可以预测这种变化的方向,并为分配保留任务的证据提供诊断基础。这些结果表明,程序检查的彻底性可能与模型评估的可靠性有所不同,它们有助于确定下一个预算单位是否应该用于新任务、新一代或额外的编辑检查。