论文

通过标注一致性和标签解耦可解释的判别式文本表示

Interpretable Discriminative Text Representations via Agreement and Label Disentanglement

模型评测评测方法与指标

摘要

可解释的文本表示应该公开的坐标不仅具有预测性,而且对于独立审核员的应用来说也足够有意义。现有的判别性表示通常使用匿名嵌入方向,而概念瓶颈和 LLM 辅助方法将自然语言名称附加到特征上,而不确保这些定义是可重现的或与目标标签不同。我们提出了可解释的判别性文本表示的操作标准:每个坐标应满足概念清晰度,通过应用特征定义的独立注释者之间的机会调整一致性来衡量,以及标签解耦,这意味着该特征不应仅仅解释预测目标。我们在 LLM 辅助特征发现(LFD)中实例化了这个标准,这是一种迭代方法,从对比结果相反的文本对中提出词汇和语义特征,使用跨 LLM Cohen 的 $κ$ 筛选候选者,并通过剩余的预测增益选择特征。程式化分析将 $κ$ 屏幕连接到每个特征注释噪声范围,将协议形式化为可靠性检查。在跨越七个语料库的十个文本分类任务中,LFD 与强大的文本瓶颈基线的预测性能相匹配,同时产生更清晰、更少标签纠缠的特征。对 232 名评估者进行的人工审核表明,LFD 特征比基线概念实现了更高的人类(人类和人类)LLM 一致性,并且评估者一致认为它们标签泄漏较少。这些结果表明,经过一致性测试、标签解缠的坐标为可解释文本分类提供了实用的可审核性标准。