论文
可读但不可控:医学 LLM 幻觉的神经元级证据
Readable but Not Controllable: Neuron-Level Evidence for Medical LLM Hallucination
摘要
幻觉仍然是部署医疗 LLM 的主要障碍之一。然而,即使可以检测到幻觉,仍不清楚与其相关的内部表征是否可以用于控制而不是单独用于检测。通过在一套医学问答数据集中使用四个开源模型,我们证明了一个简单、经过精心调节的探针可以可靠地检测幻觉,在我们的案例中,AUROC 分数在 0.77 到 0.86 之间。我们进一步表明,该信号是分布式且冗余的,而不是狭隘的局部信号。系统选择的神经元仅在非常小的子集大小上优于随机神经元,而数百个神经元的随机子集几乎恢复了完整的信号,并且低维随机投影保留了大部分检测性能。除了检测之外,我们还测试这种表示是否具有因果可操作性。在 16 个模型-数据集组合中,我们的结果揭示了可解码性和可控性之间的巨大差距。使幻觉易于检测的相同内部结构并不转化为可靠的神经元水平控制。这些发现表明,医学幻觉在内部激活中似乎很容易看到,但很难通过控制与其最相关的神经元来纠正。更广泛地说,我们的结果表明,幻觉缓解不仅仅是识别正确的神经元的问题,而且表明表征所揭示的内容与它们允许我们改变的内容之间存在更深层次的分离。