论文
基于 LLM 的测试生成中的代码运行状况:有效性和词元效率
Code Health in LLM-Based Test Generation: Effectiveness and Token Efficiency
摘要
由 大语言模型 (LLM) 提供支持的 编码智能体 现在在软件工程中很突出。之前的工作表明,人工智能工具在易于维护的高质量源代码上表现更好。在本研究中,我们研究了 LLM 生成的单元测试的有效性如何随着 CodeScene 的 CodeHealth (CH) 测量的可维护性级别的变化而变化。我们使用 Python、Java 和 C++ 的传统覆盖率指标和突变分数来评估测试有效性。此外,我们研究了如何使用常见的工业标记器将具有不同 CH 级别的代码转换为输入标记。我们的结果表明,CH 提供了 LLM 生成的测试有效性的微弱但一致的信号,并且与输入词元计数负相关。这些发现为可维护性和基于 LLM 的软件开发之间的关系提供了进一步的证据。