论文
LLM 在测试生成中采取捷径:SAP HANA 和 LevelDB 的研究
LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB
摘要
大语言模型 (LLM) 在公共基准测试中取得了令人印象深刻的结果,通常导致声称具有先进的推理和理解能力。然而,最近的认知科学研究表明,这些模型有时依赖于浅薄的启发式和记忆,走捷径,而不是展示真正的认知能力。本文研究了软件自动测试生成中的 LLM 行为,将开源系统 (LevelDB) 与 SAP HANA 的性能进行了对比。SAP HANA 是全球部署最广泛的商业数据库系统之一,其专有代码库保证不会出现在训练数据中。我们将认知评估原则结合起来,借鉴米切尔以机制为中心的评估方法,与实证软件测试相结合,采用突变评分和迭代编译器反馈修复循环来评估准确性和底层推理策略。结果表明,LLM 在熟悉的开源基准测试中表现出色,但在未知的复杂领域中表现不佳,通常优先考虑可编译性而不是语义有效性。这些发现为当前的 LLM 缺乏强有力的推理这一更广泛的主张提供了独立的软件工程证据,并强调需要惩罚琐碎的捷径并奖励真正的泛化的评估框架。