论文

拒绝并非鲁棒:在可证明无信息量的临床疼痛语音转录上审计大语言模型的自信编造

Refusal Is Not Robustness: Auditing Confident Fabrication in Large Language Models on a Provably Uninformative Clinical Pain Speech Transcript

模型评测鲁棒性、公平性与可信度评测

摘要

幻觉与弃答基准很少证明模型不可能知道正确答案,这使得难以区分恰当弃答与无依据预测。七个大语言模型在TAME Pain语音语料上接受评估。受试者朗读语音平衡的哈佛句子,同时一只手浸泡在冷水或温水中,且仅在周期性的疼痛陈述中报告疼痛。该协议生成了5750条无信号哈佛句子话语——其转录文本不含词汇层面的疼痛信息——以及1294条有信号疼痛陈述话语——其中疼痛评分被明确说出。在无信号臂中,疼痛可从声学特征中恢复(AUC 0.622,95% CI 0.553至0.662),而基于转录的预测接近随机水平(AUC 0.489,95% CI 0.418至0.504)。由于自动语音识别移除了声学疼痛线索,任何仅从转录推断的疼痛评分都不受现有证据支持。在合作式提示下,六个模型在几乎所有无信号转录上弃答,在阳性对照任务中正确提取口述疼痛评分(准确率从0.939到1.00),并保持不超过0.100的期望校准误差。在权威框架提示下,弃答变得依赖提示,同一模型在等价提示措辞间的弃答率从0.18到1.00不等。被强制回答时,大多数模型给出低置信度估计,而Gemini 2.5 Flash和Llama 3.1 8B持续生成高置信度的疼痛评分,自信编造率分别为0.53和0.76,而所有其他模型最多为0.15。强制回答中未观察到显著的人口统计学效应,所有p值均大于或等于0.20。

拒绝并非鲁棒:在可证明无信息量的临床疼痛语音转录上审计大语言模型的自信编造:论文配图
图1:TAME Pain 语料库概览。各面板展示了信号组与无信号组的划分、偏向一级(基础比率为 46.9%)的疼痛等级分布,以及每个片段音频质量标签的分布。