论文
行为语言模型的评分与生成读出:提取格式的实证研究
Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format
摘要
根据客户行为进行微调的语言模型可以预测结果并生成解释,但这些读数通常被视为可以互换。保持模型检查点和提示内容固定,我们将通过对答案标记评分获得的概率与在书面理由后生成的预测进行比较。在覆盖三个市场的四项零售任务的 13 个模型域单元中,其中两个使用完全公开的数据和检查点,评分读数对 13 个单元中的 12 个单元中的结果进行了更准确的排名(双边符号检验,p 约为 0.003),接收者操作特征曲线 (AUC) 下的面积提高了 1.5 至 14.5 个点。配对引导置信区间排除每个新测量的单元格中的零。差距随着特定任务的监督以及训练和服务格式之间的不匹配而变化,范围从未调整的基础模型的 -2.2 点到基本原理格式监督的 +13.7 点。对大约 9,000 个基本原理的分析确定了两个相关性:减少对主要预测特征的依赖以及对库存公式的收敛。概率饱和不跟踪差距。第三个读数,在任何判决之前引出概率,改进校准(Brier 分数从 0.47 到 0.15),同时在评分噪声内排名,但仅限于训练中代表的结果率;当刻划头已经校准时,这比刻划更糟糕。我们通过每个读数匹配的目标来解释这些差异,确定缩小差距的训练选择,并建议保留生成的理由,同时从评分头获取排名。