论文

计数证据,而不是句子:用于长文本价值衡量的大语言模型判决的缓和证据融合

Count Evidence, Not Sentences: Tempered Evidence Fusion of LLM Judgments for Long-Text Value Measurement

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地用于衡量长社交媒体帖子中的公共价值取向,但此类帖子通常混合了背景、引文、让步,并且只有一些表明立场的句子。现有的方法要么要求模型直接预测文档级标签,这可能过于自信,要么通过多数或软投票来聚合句子级预测,这将不确定和决定性的句子视为同等信息。我们将长文本值测量制定为决策融合问题,并提出了调和证据融合(TEF),这是一种无需训练的规则,通过从广义贝叶斯后验导出的归一化信息增益来对每个句子的对数几率进行加权。这使得不确定句子的融合分数几乎消失,同时保留决定性证据的贝叶斯最优权重。我们进一步介绍了多事件洞察网络维度(MIND),这是一个跨越五年公共事件和六个价值维度的 8,358 个中英文帖子的基准。在 MIND 上,TEF 在五个大语言模型和两种语言中平均比直接投票、多数投票和软投票中的最强基准高出 4.5 个准确点和 4.6 个宏观 F1 点。 MIND 数据集和代码可从此 https URL 获取。