论文

少量提示何时有帮助?跨模型规模、架构和输出解析鲁棒性的镜头计数效应的系统实证研究

When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness

模型评测模型能力评测

摘要

Few-shot 提示,即在将查询呈现给 大语言模型 (LLM) 之前将少量输入输出演示对添加到查询的做法,是 NLP 中最广泛采用的推理时间技术之一。然而,很少有系统的工作研究镜头计数在确定分类性能时如何与模型规模、架构和输出格式合规性相互作用。本文介绍了 AG News 四类基准 (n=200) 上五种 LLM 的对照研究,涉及六种射击计数配置(k 为 {0,1,2,3,5,8})。我们的型号涵盖专有和开源系列:Gemini Flash Lite、GPT-4o-mini、Llama 3.1 8B、Llama 3.3 70B 和 Llama 4 Scout 17B。我们报告了所有 30 种配置中具有 95% 自举置信区间 (B=10,000) 的宏观平均 F1、排列检验 p 值和 Cohen d 效应大小。我们的研究结果揭示了四种性质不同的行为机制:(1)已经在零样本下进行了良好校准的模型,显示出适度的、统计上微不足道的收益(Gemini,GPT-4o-mini); (2) 经历灾难性零样本失败但通过单个示例显着恢复的模型 (Llama 3.1 8B, d=10.98, p<0.0001); (3) 在零样本下最优的模型,随着额外的例子单调退化(Llama 4 Scout); (4) 表现出 U 形曲线的模型(Llama 3.3 70B:0-shot F1=0.907、2-shot F1=0.635、5-shot F1=0.785,解析器已校正)。我们还识别、诊断和纠正了一个系统解析工件,该工件人为地将 Llama 3.3 70B 性能降低了 206%,这对 LLM 评估实践做出了方法论贡献。我们的结果表明,镜头计数和分类性能之间的关系不是单调的、不普遍的,并且不能仅从模型规模来预测。