论文

TimeSeek:智能体预测器的时序可靠性

TimeSeek: Temporal Reliability of Agentic Forecasters

模型评测基准与评测资源

摘要

我们提出TimeSeek,一个研究智能体LLM预测器的可靠性如何随预测市场生命周期变化的基准。我们在150个受CFTC监管的Kalshi二元市场上,于五个时间检查点、分别在启用与不启用网页搜索的条件下评估10个前沿模型,共计15,000次预测。模型在市场生命早期和高不确定性市场上最具竞争力,而在接近结算时和强共识市场上竞争力明显更弱。网页搜索总体上提升了每个模型的合并Brier技巧评分(BSS),但在12%的模型-检查点组合中反而有害,表明检索平均有益但并非普遍有益。简单的双模型集成能降低误差,但总体上仍未能超越市场。这些描述性结果提示应采用时间感知的评估与选择性遵从市场策略,而非依赖单一市场快照或统一的工具使用设定。