论文

结构刚性与57词元预测窗口:大语言模型推理层可治理性的物理框架

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

模型评测模型行为与机制分析

摘要

当前的AI安全依赖于行为监控与训练后对齐,然而实证测量表明,在被测的大多数指令微调模型中,这些方法无法产生可检测的预先承诺信号。我们提出一个基于能量的治理框架,将Transformer推理动力学与神经计算的约束满足模型联系起来,并将其应用于涵盖五种几何状态的七个模型队列。利用轨迹张力(rho = ||a|| / ||v||),我们在Phi-3-mini-4k-instruct于算术约束探针上贪婪解码时识别出一个57词元的预先承诺窗口。这一结果是模型特定、任务特定且配置特定的,表明预先承诺信号可以存在但并不普遍。我们提出推理行为的五状态分类:Authority Band、Late Signal、Inverted、Flat与Scaffold-Selective。能量不对称(Σ\r{ho}_misaligned / Σ\r{ho}_aligned)作为跨越这些状态的结构刚性的统一度量。在七个模型中,只有一个配置在承诺之前表现出预测性信号;其余均表现为静默失败、延迟检测、反转动力学或平坦几何。我们进一步证明,在72种测试条件下事实性幻觉均不产生预测性信号,这与缺乏经训练的世界模型约束时的伪吸引子收敛相一致。这些结果确证了规则违反与幻觉是具有不同检测需求的两种不同失效模式。内部几何监控仅在存在阻力时有效;对事实性虚构的检测需要外部验证机制。这项工作为推理层可治理性提供了一个可度量的框架,并提出了评估自主AI系统部署风险的分类法。