论文
两个真理和一个谎言?对现成的 LLM 进行基准测试以进行需求质量评估:性能、误报和漏报
Two Truths and A Lie? Benchmarking Off-the-Shelf LLMs for Requirements Quality Assessment: Performance, False Alarms, and Misses
摘要
需求工程 (RE) 控制系统工程 (SE) 下游所有内容的质量;在审查周期中幸存下来的有缺陷的需求会导致设计返工、进度延误和成本超支。由于需求通常是用自然语言编写的,因此生成式 AI 的最新进展提高了人们对 大语言模型 (LLM) 能够吸收需求质量评估的期望,否则这项任务会很慢且需要人类专业知识密集型。然而,关于 LLM 是否可以相信这样做的经验证据仍然很少。本研究首次对现成的 LLM 性能进行基准分析,用于需求质量评估。针对基于 INCOSE 质量标准的专家衍生的 真值,我们评估了跨越两个系列(OpenAI 和 Anthropic)的十个模型,每个模型各有五代,涵盖一百次独立运行、两个要求集和五个采样温度。以下是四项贡献。首先,我们量化了强烈不对称的错误概况:在所有模型和运行中,表现最好的人择模型仅检测到 47% 的专家识别问题,而错误标记了 11%。其次,在需要 SE 判断的情况下,性能会显着下降,因为几乎总是会忽略必要性和正确性问题。第三,代际进步是非单调的,因此不能更好地假设新模型。第四,这种误差行为在采样温度范围内仅适度且非单调地变化,表明特征模型缺陷而不是固有的随机性。因此,现成的 LLM 还不是值得信赖的自主评估器。研究结果还提醒 Agentic AI 开发人员注意:在专门的架构中编排这些 LLM 模块可能会加剧这些缺陷,而不是纠正它们。他们的近期作用是人机交互决策支持。