论文

当衍生测量误导时:以特权模态可靠性证据量化并缓解LLM过度信任

When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence

模型评测评测方法与指标

摘要

衍生测量正日益作为直接事实进入大语言模型(LLM)流水线,尽管其有效性依赖于具体实例。我们将衍生特征过度信任(DFOT)定义为这样一类失效:下游LLM赋予此类测量与直接事实同等的认识地位,或在其有效范围之外使用它。以生理传感作为案例研究,D1测试模型是否接受被离线心电图(ECG)反驳的PPG衍生心律,而D2测试模型是否在误导性的危重病史下拒绝经离线确认的可靠PPG心律。ECG提供训练监督并用于构建离线参考,但从不向LLM展示。五个估计量对这一链条进行量化:冲突过度信任率(COTR)与情境诱发错误率(CIR)刻画D1/D2;正确修复率(CRR)衡量冻结错误的修复;证据特异性修复边际(ESRM)对比匹配证据与患者不重叠的打乱证据;效用损害率(UHR)衡量高可靠性(HIGH)案例中出现的不必要验证——这些案例在基线中本无需验证即可使用。该框架不依赖于特定的可靠性生成器。我们在50,000条PPG-ECG配对记录上演示该框架,以ECG到PPG的特权蒸馏作为示例性基线,推理阶段仅使用PPG。在协议锁定的187名患者测试集上,该基线将四项修复与特异性终点提升1.82至6.69个百分点,所有配对置信区间均不含零;UHR上升0.67个百分点(95% CI:-0.4至+1.7)。DFOT为更强的缓解方法提供了共同的评估目标。代码已发布于 https://github.com/Zongheng-Guo/When-Derived-Measurements-Mislead。

当衍生测量误导时:以特权模态可靠性证据量化并缓解LLM过度信任:论文配图
图 1:DFOT 框架的端到端实例化。概念验证特权学生将仅训练的心电图监督转换为仅 PPG 的可靠性证据。基线可靠性生成器 (B2) 使用传统的仅 PPG 可靠性模型,而所提出的特权生成器 (K2) 将 ECG 派生的特权信息提取到部署时 PPG 可靠性估计中。大语言模型界面的中心匹配与改组评估措施修复(CRR)和证据包特异性(ESRM)。 KD:知识蒸馏; AF:心房颤动; E:可靠性证据。