论文

PromptResponse:优化 LLM 编码任务的提示

PromptResponse: Optimizing Prompts for LLM Coding Tasks

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用于研究工作流程和软件开发流程,但它们的输出仍然对输入提示变化敏感。本文介绍了 $\unicode{x00AB}$PromptResponse$\unicode{x00BB}$,这是一项对照研究,旨在检验编码任务提示的格式化和基于 LLM 的调整如何影响生成的代码的性能、效率和稳定性。使用 HumanEval 数据集$\unicode{x2014}$baseline、JSON、Markdown、YAML 和 LLM 调整版本$\unicode{x2014}$的五个语义相同但语法不同的变体,我们让 GPT-4o 解决了超过 8200$\unicode{x00A0}$ 执行的编码问题。我们的结果表明,一致的格式$\unicode{x2014}$尤其是JSON$\unicode{x2014}$提高了生成效率和语法稳定性,并且任务性能略有提高。相反,LLM 调整的提示会导致任务性能显着下降,而在任何其他方面却没有显着改善。这些发现表明,仅简单的重新格式化就可以产生可衡量的改进,而调整必须考虑模型对齐。我们通过提供一系列根据我们的结果提供的实用建议来结束我们的工作,并发布我们的数据集变体和评估管道以供未来的工作。