论文

规范驱动开发中的引文规则:LLM 生成代码中输出确定性和自动幻觉检测的跨模型实证研究

Citation Discipline in Spec-Driven Development: A Cross-Model Empirical Study of Output Determinism and Automated Hallucination Detection in LLM-Generated Code

摘要

规范驱动开发 (SDD) 框架通过正式规范指导 大语言模型 (LLM) 支持的代码生成,但它们在如何强制需求和生成的代码之间的可追溯性方面存在根本差异。本文提出了两项​​比较三个 SDD 框架的受控实证研究: $traceSDD$,它使用分层 REQ-XXX.Y.Z 标识符强制执行每行强制引用; $Spec Kit$,通过用户故事和验收标准使用工件级可追溯性;和 $OpenSpec$,它依赖于事后外部跟踪图。我们测量了两个前沿 LLM 的两个主要结果 - Claude Sonnet 4.6(N=20,4 个条件,240 个实现)和 GLM-5-turbo(N=50,4 个条件,600 个实现):$output$ $确定性 $(独立 LLM 会话之间的词汇相似性)和 $automated$ $hallucination$ $detection$ $rate$ (TDR)。我们的预注册分析揭示了一致的跨模型重复权衡:未引用的条件比引用的条件产生显着更高的确定性(Claude:$d=-0.76$,$p=0.003$;GLM:$d=-0.72$,$p<0.001$),而只有引用的条件才能实现自动幻觉检测(TDR:Claude 86.4%,GLM 88.0%, vs 所有替代方案均为 0%,两项研究中 FPR=0%)。在确定性方面,traceSDD(引用)显着优于 $Spec Kit$(Claude:$d=0.47$,$p=0.049$;GLM:$d=0.42$,$p=0.003$),但不优于 OpenSpec(Claude:$d=0.18$,$p=0.44$;GLM:$d=0.14$,$p=0.32$)。这些发现表明,引文注释用确定性换取了可验证性,并且这种权衡适用于整个模型架构。