论文

OracleProto:经知识截止与时间遮蔽评测LLM原生预测能力的可复现框架

OracleProto: A Reproducible Framework for Benchmarking LLM Native Forecasting via Knowledge Cutoff and Temporal Masking

模型评测评测方法与指标

摘要

大语言模型正从静态文本生成器走向真实决策支持系统,预测是联结信息收集、证据整合、态势判断与行动决策的复合能力。该能力在金融、政策、产业与科研中被广泛需求,但评估困难:前瞻式基准在答案出现前评估预测,是测量预测力最干净的方式,但事件落定后即失效;回溯式基准可复现,却无法可靠区分真实预测与模型预训练中可能学过的事实;让模型「假装不知道」无法替代真正的知识边界。我们提出OracleProto:评测LLM原生预测能力的可复现框架。它把已落定事件重构为时间有界的预测样本,结合模型截止对齐的样本准入、工具级时间遮蔽、内容级泄露检测、离散答案规范化与层级评分。在FutureX-Past衍生数据集上以六个当代LLM实例化,OracleProto在受控信息边界下区分预测质量、采样稳定性与成本效率,同时把残余泄露降到1%水平——比仅工具的时间过滤低一个数量级。OracleProto把LLM预测从一次性评估变为可审计、可复用、可训练的数据集级能力,为公平跨模型比较提供统一接口,并为下游SFT与RL提供受控信号源。代码与数据公开。

OracleProto:经知识截止与时间遮蔽评测LLM原生预测能力的可复现框架:论文配图
图 1:OracleProto 概述。以可重复运行单元ℛ=(𝒟,M,κM,δ,T,C,R,Ψ,phi, gamma)\mathcal{R}=(\mathcal{D},M,\kappa_{M},\delta,T,C,R,\Psi,\phi,\Gamma)为中心,框架指定了数据集、模型、知识截止、时间偏移、交互和搜索预算、提示渲染器,解析器、标准化规则和评分协议。给定一个已解决的现实世界事件,根据 OracleProto 的原理,已解决的现实世界事件将被重建为结构化预测实例的数据集,每个数据集包含待决的预测问题、候选答案、经过验证的黄金结果和事件发生时间。在推理时,代理在时间屏蔽的信息边界下进行预测,其中只能访问预截止知识和泄漏过滤的搜索证据。然后,对原始预测进行解析、标准化,与黄金答案进行比较,并汇总为项目、问题和模型级别的评估分数。