论文

关于 LLM 适应性的限制:模型内化先验对注释任务性能的影响

On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于零样本注释和 LLM 作为法官任务,但其可靠性取决于模型内部化先验如何与用户提供的指令交互。我们研究了这种交互的三个维度:(1)LLM 对数据和任务定义的熟悉程度与性能有何关系,(2)提示中的附加信息是否可以纠正零样本错误(“决策粘性”),以及(3)模型对未对齐的任务定义的敏感性。我们引入了定义特定熟悉度(DSF),它衡量模型引出的概念与目标定义之间的一致性。在 9 个 LLM 和 6 个毒性数据集(五个主要数据集加上一个额外的稳健性数据集)中,DSF 在控制数据集身份(部分 $r=+0.41$)后预测注释性能。在所有测试的提示条件下,这种关联仍然是积极的。相比之下,三种常见的文本记忆指标没有显示出正相关。我们表明提示的纠正能力有限:只有 34.8% 的零样本错误可以通过额外的指令或示例来纠正,其中高置信度错误尤其持久。不一致的定义会系统地改变预测,而不会降低报告的置信度,从而使检测定义与策略不匹配的置信度变得不可靠。总之,这些发现将定义一致性确立为实用的模型选择标准,并表明单独更好的提示不能替代验证模型与政策的契合度。