论文

罕见异常失败下的解释性投入:模型行为的渐近稀有性(又名:渐近式AI)

Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI)

模型评测模型行为与机制分析

摘要

以往关于LLM在异常条件下行为的研究,问的是模型能否察觉异常。我们提出一个更窄的问题:当模型处于失败率低且可控的工作流中时,随着失败在渐近意义上越来越稀有,其解释性投入——长度、具体性、自报置信度——是否会发生变化?我们在三个开源权重模型(qwen3:8b、llama3.1:8b、mistral:7b)上构建了本地零成本实验框架,运行重复的工具调用任务,其中一次调用以概率p失败,从0.2到0.0001扫过八个失败率,并在从即时提示词到无提示词的五种引导条件下进行。我们假设随着失败越来越稀有,投入先上升,然后在可检测性阈值附近崩溃。跨条件合并来看,这一假设似乎是错误的:长度呈平坦的单调下降。按条件拆分后,这一结论被推翻。在immediate_forced条件下(模型必须即时解释每一次失败),预测的上升得到确认,但随后是平台期而非崩溃:长度在p=0.05时达到峰值28.4词,在最稀有失败率下稳定在17.4-19.0词,置信度从约53%不均匀地升至70%-90%区间。在grouped_runs条件下(解释批处理到运行结束时),未出现崩溃。在passive_unprompted条件下,总体量级是下限伪影,但一次被找回的日志缺口揭示了真实的、模型特异的自我监控:llama3.1:8b会在无提示词情况下主动给出结构化置信度报告,且随试验累积有时会削弱自身置信度;另外两个模型仅以套话形式出现过一次。引导结构是崩溃可观测性的一阶调节变量。一次配套的保证失败运行(72个单元,回填随机采样中真实失败为零的失败率)表明,模型在是否识别异常上存在差异,这与识别之后的投入是两回事。局限:离散的失败率点无法捕捉其间的行为,这是未来工作的方向。