论文
语义纤维和交叉语法干扰:过完备表示中安全漂移的计算
Semantic Fibers and Cross-Gram Interference: A Calculus of Safety Drift in Overcomplete Representations
摘要
部署的语言模型可能会拒绝有害的英语请求,但会遵守其忠实的翻译,从而揭示出无法仅通过输出行为可靠地表征的跨语言安全故障。我们通过审计的等价关系形式化了这种现象,并表明,对于声明的商、表示、度量、特征字典、评分头、阈值和对比度模型,所产生的安全漂移承认精确的线性代数表征。具体来说,漂移是纤维内对比度的跨革兰氏函数;其最差容许值是支持函数,而边际不变性的特征是消灭条件。我们引入了一种内在的校准暴露测量,由杠杆对偶性 $χ^2=1/\ell-1$ 控制,它将观察到的漂移分为三个诊断上不同的状态:通过重新校准可消除的读取器故障,条件太差而不可靠的精确校正,以及仅读出干预无法消除的表示级冲突。因此,相同的观察到的暴露可能会导致根本不同的补救判决。该框架还扩展到锥值安全头。不受限的订单交换身份为线性控制接口提供了诊断;其校准状态残差预测了未见状态和目标上明显的三控制组合误差,实现中值 Spearman 相关性 0.964 美元,而静态跨 Gram 基线为 0.269 美元。 ETC.....