论文
大语言模型 设计综合的可靠性:方差、提示灵敏度和方法支架的实证研究
Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding
摘要
大语言模型 (LLM) 越来越多地应用于自动化软件工程任务,包括从自然语言描述生成 UML 类图。虽然之前的工作表明 LLM 可以生成语法上有效的图表,但语法正确性本身并不能保证有意义的设计。本研究调查了 LLM 是否可以超越图表转换来执行设计综合,以及它们在变化情况下如何可靠地维持面向设计的推理。我们引入了一种基于偏好的小样本提示方法,该方法将 LLM 输出偏向于满足面向对象原则和模式一致结构的设计。两个设计意图基准,每个都有三个仅域的释义提示和 10 次重复运行,用于评估三种 LLM(ChatGPT 4o-mini、Claude 3.5 Sonnet、Gemini 2.5 Flash)的三种建模策略:标准提示、规则注入提示和基于偏好的提示,总共 540 个实验(即2x3x10x3x3)。结果表明,虽然基于偏好的对齐提高了对设计意图的遵守,但它并没有消除不确定性,并且模型级行为强烈影响设计可靠性。这些发现强调,实现可靠的 LLM 辅助软件设计不仅需要有效的提示,还需要仔细考虑模型行为和鲁棒性。