论文
说的比他们知道的更多:大语言模型 中量化认知修辞错误校准的框架
Saying More Than They Know: A Framework for Quantifying Epistemic-Rhetorical Miscalibration in Large Language Models
摘要
大语言模型 (LLM) 表现出系统性的错误校准,修辞强度与认知基础不成比例。本研究测试了这一假设,并提出了一个通过设计三元认知修辞标记(ERM)分类法来量化这种脱钩的框架。该分类法通过形式意义分歧(FMD)、真实与表演认知比(GPR)和修辞手段分布熵(RDDE)的综合指标来实施。该框架应用于涵盖人类专家、人类非专家和 LLM 生成的子语料库中约 60 万个标记的 225 个论证文本,识别出一致的、与模型无关的 LLM 认知签名。 LLM 生成的文本产生三角号的速度几乎是专家速度的两倍 ($Δ= 0.95$),而人类作者产生色情的速度是 LLM 速度的两倍多。在 LLM 输出中,执行的犹豫标记出现的密度是人类密度的两倍。相对于两个人类群体,LLM 文本中的 FMD 显着升高($p < 0.001,Δ= 0.68$),并且修辞手段在 LLM 文档中的分布更加均匀。这些发现与源自格莱斯语用学、关联理论和布兰多姆推理主义的理论直觉一致。注释管道是完全自动化的,使其可部署为轻量级筛选工具,用于 AI 生成的内容中的认知错误校准,并可作为 LLM 生成的文本检测管道的理论上驱动的功能集。