论文
CreativePreferences默会偏好
Verifiable, Articulable, and Tacit Components of Preference
摘要
什么让短篇小说引人入胜、新闻有价值、数学证明优雅?这些构念难以表述或验证,其意义至少部分是默会的。然而现代AI模型主要经由已表述的宪法、量规与验证器(RLAIF与RLVR)改进,偏好的默会成分通常研究不足。我们发布大型带标注偏好数据集CreativePreferences:横跨7个创意领域的280万条文本、3.17亿次人类偏好判断,含42个基准任务。我们分别用可执行程序、量规库与稠密训练的模型(V、A与VAT)建模这些标注,观察到稳健的可表述差距(VAT-VA)与可验证差距(VAT-V),并用一种发现可表述与可验证指标、识别伪变量、以捕获再捕获估计未发现指标价值的新测量方法估计各差距的上下界。这些差距在所有领域出现,包括传统上被视为完全可验证的领域:以正确性为中心的数学与软件工程,以及以主张与新颖性为中心的新闻、专利与同行评审。差距大小随领域而变(同行评审与创意写作可表述差距最大),并随参与评判人数增加而扩大,与Collins的集体默会知识一致。我们展示两个后果:(1)在人类生成内容上,完整模型更贴近人类偏好,常与已表述判据相左;(2)作为古德哈特定律的类比,表述偏好会使偏好偏离其默会维度。