论文
SICI:语义-语用复杂性指数揭示了 LLM 立场检测中的制度转变
SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection
摘要
基于提示的 LLM 越来越多地用于立场检测,但更难的示例并不总是可以通过更清晰的说明、推理提示、检索或辩论来修复。我们引入了 SICI(立场推理复杂度指数),这是一种对目标文本对造成的语义语用负担的七维诊断度量。在 SemEval-2016 和 VAST 中,SICI 预测 LLM 的准确性优于表面代理,并显示出显着的交叉评分者可靠性($α=0.771$)。更重要的是,随着 SICI 的增加,LLM 错误会发生变化:低复杂度的例子会导致过度归因,尤其是反对预测;中间的例子形成不稳定的边界;而高复杂度的例子很快就集中在 None 上。这种类似相变的结构在 GPT-3.5、GPT-4o-mini、DeepSeek-V3 和 GPT-4o 中持续存在,尽管更强的模型会移动边界。一项包含 15 种方法的干预研究进一步表明,提示、检索和辩论通常会沿着归因-弃权轴改变模型,而不是消除高复杂性瓶颈。