复杂性扭结:代码生成可靠性的即时结构复杂性指数
The Complexity Kink: A Prompt-Side Structural Complexity Index for Code-Generation Reliability
摘要
从生成的代码中测量的复杂性取决于失败:困难的提示可能会产生较短的失败程序,并被分配较低的输出复杂性。我们引入了一个六维提示侧结构复杂性指数,该指数在生成之前进行评分,并与正确性分开。我们在初步单一评估者评分标准的六个级别中选择了 5,000 个 Python 提示。四名非小组 LLM 评分员对锁定的提示重新评分,给出 19,997 行分数;在所有四个评级的 4,998 条提示中,综合评级者间信度为 ICC = 0.872。我们根据提示评估 21 个模型,产生 105,000 代。在未经调整的平均合并分析中,通过率在综合 13.75 处有一个非单调断点,其中 79.9% 等于或低于,87.6% 高于。这不是通用的故障截止值。任务型固定效应将断点移至 10.75,并将制度差距从 7.6 点缩小至 2.1 点。构造框架控制将其转移到 8.50,原始差距为 -3.5 点,并且没有一个框架单独再现了汇总的 +7.6 点变化。特定型号的拟合包括 16 种向上变化和 5 种向下变化。 365 提示审计清理扩展与 bin 15 和 16 处的原始五模型估计相匹配,但在 bin 16 之上仅添加了 14 个提示。在具有可计算 Lizard 复杂性的零传递生成中,28.5% 与高于 8 的提示组合配对,输出复杂性最多为 10。人类一致性是中等的,并且依赖于富含分歧的校准集;释义和跨语言重新评分保留分数排序。过度识别检验拒绝对六个维度的联合限制,因此我们将综合视为一个指数,并且不对 2SLS 估计值进行因果解释。其贡献是生成前的测量框架和可靠性制度的有限观测分析。