论文

使用 LLM 进行早期产品线验证:半形式化蓝图分析研究

Early-Stage Product Line Validation Using LLMs: A Study on Semi-Formal Blueprint Analysis

模型评测模型能力评测

摘要

我们研究大语言模型(LLM)是否可以直接在半正式文本蓝图上执行特征模型分析操作(AO),即特征层次结构和约束的简洁约束语言描述,从而能够在软件产品线范围界定中进行早期验证。使用 12 个最先进的 LLM 和 16 个标准 AO,我们将它们的输出与基于求解器的预言机 FLAMA 进行比较。结果表明,推理优化模型(例如 Grok 4 Fast Reasoning、Gemini 2.5 Pro)在所有评估的蓝图和操作中实现了 88-89% 的平均准确度,接近求解器的正确性。我们识别结构解析和约束推理中的系统错误,并强调为模型选择提供信息的准确性与成本权衡。这些发现将 LLM 定位为早期变异性验证的轻量级助手。