论文
野外提示:代码中交易提示的大量分析集合
Prompts in the Wild: A Large Analyzed Collection of Transactional Prompts in Code
摘要
当代生成 大语言模型 (LLM) 的行为直接由提示、描述所需输出和模型行为的非结构化文本决定。在本文中,我们认为提示是语言对象,本身就值得研究。为此,我们从 GitHub 收集了 57.5K 个独特的提示样本。具体来说,我们专注于事务提示:集成到软件中的可重现的自然语言指令。为了能够对提示进行实证、定量研究,我们引入了结构化本体,捕获提示的属性及其形式和语义组成部分。基于这个本体论,我们将提示从非结构化的原始文本转换为丰富的结构化语言对象。对这些结构化数据的分析揭示了跨语言、领域、任务和模式的使用模式的显着多样性,在典型的 Zipf 式分布中,其中一些明显占主导地位,而其他更多样化的出现在长尾中。为了验证基于本体的提示注释的可靠性,我们对所有领域进行了全面的错误分析,提供了注释质量的详细评估。我们将数据集与浏览和探索界面一起发布(https://github.com/OnlpLab/transactionalPromptsCollection)。