论文
OracleProto:经知识截止与时间遮蔽评测LLM原生预测能力的可复现框架
OracleProto: A Reproducible Framework for Benchmarking LLM Native Forecasting via Knowledge Cutoff and Temporal Masking
摘要
大语言模型正从静态文本生成器走向真实决策支持系统,预测是联结信息收集、证据整合、态势判断与行动决策的复合能力。该能力在金融、政策、产业与科研中被广泛需求,但评估困难:前瞻式基准在答案出现前评估预测,是测量预测力最干净的方式,但事件落定后即失效;回溯式基准可复现,却无法可靠区分真实预测与模型预训练中可能学过的事实;让模型「假装不知道」无法替代真正的知识边界。我们提出OracleProto:评测LLM原生预测能力的可复现框架。它把已落定事件重构为时间有界的预测样本,结合模型截止对齐的样本准入、工具级时间遮蔽、内容级泄露检测、离散答案规范化与层级评分。在FutureX-Past衍生数据集上以六个当代LLM实例化,OracleProto在受控信息边界下区分预测质量、采样稳定性与成本效率,同时把残余泄露降到1%水平——比仅工具的时间过滤低一个数量级。OracleProto把LLM预测从一次性评估变为可审计、可复用、可训练的数据集级能力,为公平跨模型比较提供统一接口,并为下游SFT与RL提供受控信号源。代码与数据公开。
