论文

CORDIAL:校准少数标签的序数 LLM 输出

CORDIAL: Calibrating Ordinal LLM Outputs from Few Labels

模型推理推理验证与自校正

摘要

大型语言模型 (LLM) 可以将文本转换为有序尺度上的分布,但该分布是一种噪声测量:饱和、压缩或夸大,并且偏向一致的方向。我们提出了 CORDIAL,它将模型的输出视为真实标签的噪声读数,并使用五个可解释参数的通道对其进行纠正。该通道足够小,可以对少数标签进行后验平均,并且我们证明最终的校准保留了一阶随机顺序。在亚马逊评论和四位大语言模型的 CMU-MOSEI 成绩单上,CORDIAL 在 80 个设置中的 76 个设置中具有 5 到 100 个标签的 9 个校准器中的对数损失最低;具有 20 个标签和主要 7B 阅读器,它与使用 28-54 个标签的最强基线相匹配。同样的后验让我们可以从其他任务中学习先验并融合多个大语言模型。仅当校准集增长到数百或数千时,不受限制的校准器(例如狄利克雷校准)才会超越它。