论文

HindsightBench:时间索引 LLM 决策任务中参数化后见之明的黑盒行为审计协议

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

模型评测评测方法与指标

摘要

大语言模型 将历史日期之后的参数知识泄漏到按该日期索引的决策任务中 - 不一定是对已实现结果的查找,但仍然是该时期的知识。存在已定;用户缺少的是一种审计给定模型的廉价方法。我们提出了 HindsightBench,这是一种黑盒审计协议,可以在任何时间索引的 LLM 决策任务中以探针级成本(无回溯测试、无日志概率、无语料库访问)分析参数后见之明。它链接了一个四臂日期操纵矩阵(显示/仅日期/屏蔽/移植)、双记忆探针(日期恢复;结果回忆)和六个指标——触发强度、移植效果、截止后安慰剂、可恢复性、行为有效截止和回忆准确性分离——具有明确的门,其中可识别性是数据依赖的。将其应用于 258 节点复古校正宏面板上来自 7 个供应商的 15 个模型时,它会产生三种模式:(i) 日期触发反射不是规模现象 - 它跟踪训练新近度,尽管此处未识别安装它的内容:在每个可测量的 2024 年开放权重行中不存在,包括具有截止对齐召回倾向的 70B 层,存在于每个测试的 2026 代模型中,并且打开在同一个 MoE 系列中的一个供应商谱系 (Qwen3 -> Qwen3.6) 内,处于 ~3B 活动状态; (ii) 供应商的有效截止时间跨度为 22 个月,并且比供应商报告的日期早最多 8 个月,从而使日历窗口安慰剂无效; (iii) 结果对于服务不是不变的——FP8 参考模型的 BF16 服务破坏了触发估计的稳定性,而 AWQ-INT4 保留了它,并且提供者锁定的推理机制使一个探测不收敛——因此协议将量化和思维机制作为其合同的一部分。我们发布面板、预注册、审核行、成绩单和单命令重新生成。