论文

检测!=可靠的控制:可解码的同理心方向最多会产生自动同理心分数的部分变化

Detection != Reliable Control: Decodable Empathy Directions Yield at Most Partial Shifts in Automated Empathy Scores

模型评测模型行为与机制分析

摘要

可解码的“同理心”方向通常被解读为因果杠杆,将可解码性、自动度量控制和人类感知的变化混为一谈。我们在三个指令调整的 LLM 中测试了两个 EPITOME 衍生的方面——识别(认知)和共鸣(情感),用两名 LLM 法官和一个判别性 EPITOME 分类器对每次干预进行评分,每个分类器都由情绪与中性阳性对照进行门控。控制传递到所有自动化仪器的情感方面,但认知范围在它们之间不一致。在对句子嵌入派生的表面分数进行残差后,两个方面都保持可解码,并且转向可以基本上重写文本。然而,添加共振方向仅部分提高了情感分数——在 Qwen 中提高了 +0.29(大约是自然差距的 26%)。方向间的直接对比证实了 Qwen 和 Llama(不是 Gemma)中的移动是特定于面的;然而,我们并没有建立一个匹配的人类感知的变化。附加认知转向不会产生可测量的变化,但域内控制表明认知工具太粗糙,无法解决此类转向产生的差异 - 无法测量,不是干净的零。相比之下,即使在调整响应长度后,Gemma 识别消融也会降低分类器的认知得分。检测并不意味着在全球干预下进行可靠的控制,认知同理心主张需要进行明确的测量敏感性检查。