论文

托管LLM的可复现但难持续:行动时信念评估中的测量敏感性

Replication Without Persistence in Hosted LLMs: Measurement Sensitivity in Action-Time Belief Evaluation

模型评测鲁棒性、公平性与可信度评测

摘要

对托管语言模型的行为评估可能因被评估服务、测量工具或两者在多次运行间存在差异而变化。我们区分三个验证问题:在历史配置下,先前结论是否在新数据上复现(复现);在同一标识符下重建评估与推理配置时,端点是否改变(测量敏感性);在同一通用工具下,结论是否在后续测试的标识符上持续(持续性)。我们在Regent Chess中研究这些问题——一个精确记录隐藏可变状态的序贯环境,使陈述信念可在行动时对照真值打分;正的端点值意味着比匹配均匀分布比较器更差。此前报告的Gemini 3.1 Flash-Lite缺陷在其历史配置下的新棋局上复现(+0.0530,95% CI [+0.0329,+0.0714])。在同一公共标识符下当天背靠背的H/R比较中,重建配置下的模型减均匀端点低0.0429(H减R对比的95% CI [+0.0182,+0.0667]);六个配置组件联合变化,因此无法分离任何单一组件。在重建的R下,前瞻冻结、交错同窗口的4K比较在Gemini 3.1与Gemini 3.7之间反转符号——两者在发布与产品层级上不同;其他描述性与探索性单元呈现相同方向模式。服务期的额外贡献仍未解决(-0.0166,[-0.0483,+0.0157])。因此,复现、测量敏感性与持续性可能在同一次评估中给出不同结论,这促使我们按被测标识符、服务期、测量工具与推理配置对托管模型行为结论进行显式索引。