论文
虚假和不可能是人工智能语言表征的不同方向
Falsehood and Impossibility Are Different Directions in an AI's Representation of Language
摘要
语言可以描述错误的事态和根本不可能的事态。人工智能模型是否能在内部区分这些故障仍不清楚。我报告了一项对多模态开放权重模型 Gemma 3 4B IT 的探索性激活研究,该研究使用了来自 17 个哲学家族的 85 个提示和由 15 个主题组成的主题匹配模式集,每个主题都表达为真理、偶然的谎言、不可能的主张、语义异常和必要的谎言。在其答案中,该模型将偶然的虚假陈述与矛盾混为一谈,将 15 个虚假陈述中的 12 个标记为“矛盾”。它的激活表现出不同的模式。线性真值探测可以将不可能的陈述与真实的陈述分开(AUC 0.93),但不能将不可能的陈述与错误的陈述分开(AUC 0.20)。对保留主题族进行评估的不可能性探针在 AUC 1.00 处将必要性与偶然性虚假分开,在第 15 层达到峰值,平衡精度为 0.97(Bonferroni 调整的 P=0.018)。真实方向和不可能性方向接近正交,而不可能性方向与语义异常方向部分重叠,同时保持与语义异常方向的可区分性。同一层的稀疏自动编码器特征重复此几何形状。选择性不可能的功能也会针对异常句子,但很少针对偶然的谎言。在该模型的激活空间中,必要的虚假信息不是偶然虚假信息的极端情况,而是更接近实验定义的语义异常类别。这种代表性的接近并不意味着不可能的陈述本质上毫无意义。这些来自一个小模型的相关观察结果为一种古老的哲学区分提供了经验脚注。