论文

相同的证据,不同的目标:解码诊断证据如何与语言模型状态的因果问题相关

Same Evidence, Different Target: Decoding How Diagnostic Evidence Bears on Causal Questions from Language-Model States

模型评测模型行为与机制分析

摘要

当同一诊断结果涉及不同的人群、结果、估计值、路径或识别假设时,相同的诊断结果可以支持或挑战一种因果主张,但无法解决另一种因果主张。当证据和目标同时变化时,正确答案可能反映有利或不利的措辞、词汇重叠或熟悉的诊断模式,而不是将证据与因果问题相匹配。我们引入配对提示,在改变因果目标的同时逐字重复相同的诊断证据。根据证据与因果问题的关系,每个提示都被标记为“有利”、“挑战”、“未解决”或“错误目标”。仅当两个提示都正确分类时,才会恢复一对。使用在单独的开发集上训练的线性读数,我们分析了 Qwen2.5-7B-Instruct、Qwen3-8B 和 Llama-3.1-8B-Instruct 的倒数第二个 Transformer 块的最终词元隐藏状态。在涵盖 9 个诊断系列的 49 对主要基准上,平衡准确度范围从 0.654 到 0.659,恢复了 18-21 对。两位独立的人工审阅者为 98 个提示中的 95 个提示分配了相同的标签 (96.9%)。跨检查点,平衡的准确性和完整对恢复超过了保留开发场景组的排列空值。在 Qwen2.5 中,完全提示平衡精度超过了两个受限输入,两个差值均大于零的配对引导间隔。在没有来自评估的诊断家族的开发示例的情况下训练的读数恢复了 21 对,包括 9 个家族中每个家族中的至少一对。隐藏状态读数超出了答案选项 logits 和文本基线上的线性分类器的平衡精度和恢复对。这些结果表明,隐藏状态包含关于诊断证据是否支持、挑战或未能解决因果目标的线性可解码信息。