论文

根据提示语言特征预测 LLM 性能:需求工程的实证研究

Predicting LLM Performance from Prompt Linguistic Features: An Empirical Study in Requirements Engineering

模型评测模型行为与机制分析

摘要

背景。 LLM 输出对提示表述高度敏感:微小的措辞变化可能会严重影响输出质量。这在软件工程中很重要,提示可以指导需求分析、代码生成和工件合成。糟糕的公式会产生不可靠的人工制品,但实践者缺乏在推理之前评估提示的原则性方法,使得选择依赖于昂贵的 LLM 调用和试错改进。目标。我们研究提示的可测量语言属性是否可以在推理之前预测 LLM 性能,从而实现低成本提示选择和细化,并在针对 F1、F2、精度和召回率的二进制需求分类上进行验证。方法。我们通过改变 30 个语言指标,从 100 个初始提示中生成 9,000 个语言控制的提示变体,并使用 5 个开源 LLM 对 625 个带注释的要求进行评估。回归预测器通过分层 10 倍交叉验证和基于排列的显着性测试进行训练;特征重要性分析可识别跨 LLM 和模型特定的预测因子。结果。语言特征显着预测所有目标的即时表现(R2 [0.38,0.42],q<0.05)。句法和形态句法特征驱动大多数预测信号;跨 LLM 预测变量包括复合依赖分布、连词密度和单词/句子长度,反映了对领域词汇和复杂结构的敏感性。结论。结果表明对即时工程的实际影响,包括降低 LLM 性能的语言模式与增加人类理解难度的语言模式之间的重叠,以及词汇多样性作为质量维度的不相关性。更广泛地说,语言分析与标准回归相结合,在昂贵的优化流程之前提供了有效的、可解释的、低成本的先验。