论文

修辞角色标签中困难示例的推理时语义重新排序

Semantic Reranking at Inference Time for Hard Examples in Rhetorical Role Labeling

模型推理推理验证与自校正

摘要

修辞角色标签 (RRL) 为文档中的每个句子分配功能角色,广泛应用于法律、医学和科学领域。虽然语言模型 (LM) 实现了强大的平均性能,但它们在预测置信度较低的困难示例上仍然不可靠。现有方法通常隐式处理不确定性,并将标签视为离散标识符,忽略标签名称中编码的语义信息。我们引入了 RISE,这是一种推理时语义重新排序框架,它利用标签语义来完善对硬实例的预测。 RISE 自动识别低置信度预测,并使用对比学习的标签表示对模型输出重新排序,而无需重新训练或修改底层模型。在具有 7 个 LM 的 8 个特定领域 RRL 数据集(包括基于编码器和因果架构)上进行的实验显示,在困难示例上平均增益为 +9.15 个宏 F1 点。为了可解释性,我们进一步提出手动硬度注释,从模型和人类的角度研究难度,揭示了与 Cohen 的 kappa = 0.40 的适度一致性。