论文
算法编程任务中成本高效的大型语言模型的实证评估
An Empirical Evaluation of Cost-Efficient Large Language Models on Algorithmic Programming Tasks
摘要
本研究根据经验评估是否可以信任经济高效的大型语言模型 (LLM) 来生成符合书面规范的企业代码。三个模型(Gemini Flash 3、GPT-5.4 mini 和 Claude Haiku 4.5)被要求解决 992 个算法问题,作为符合强制签名和数据传输对象规范的 Java Spring Boot 服务方法,跨越四种模型和代理编码工具组合与两个提示变体,产生八种配置,禁止迭代和明确禁止硬编码答案。保留了八个问题陈述,以探究模型如何响应缺失的输入。 7,593 个结果方法按照八类结果分类法进行分类,描述了每种方法在生成答案方面的作用,然后部署和执行,将 7,936 个测量请求加入到该分类中。结构一致性接近上限,但 38.4% 的方法没有计算它们返回的值,并且只有 12.9% 的返回答案是正确的。以结果类别为条件表明,响应可靠性和正确性呈负相关,而真正的计算方法回答的频率最低,正确率为 19.3%。限制包括每个配置的单生成运行、部分Harness覆盖、单遍计时、句法分类和可能的语料库污染。