论文

Prediction Arena:在现实世界预测市场上对人工智能模型进行基准测试

Prediction Arena: Benchmarking AI Models on Real-World Prediction Markets

智能体系统Agent任务评测

摘要

我们推出 Prediction Arena,这是一个评估人工智能模型预测准确性和决策的基准,使它们能够利用真实资本在实时预测市场上自主交易。与综合基准不同,Prediction Arena 在实际交易所(Kalshi 和 Polymarket)执行交易的环境中测试模型,提供无法被操纵或过度拟合的客观 真值。每个模型作为独立代理运行,起价为 10,000 美元,每 15-45 分钟做出自主决策。在为期 57 天的纵向评估(2026 年 1 月 12 日至 3 月 9 日)中,我们跟踪了两个队列:实时交易中的 6 个前沿模型(队列 1,完整周期)和模拟交易中的 4 个下一代模型(队列 2,3 天初步)。对于队列 1,最终 Kalshi 回报范围为 -16.0% 到 -30.8%。我们的分析确定了一个清晰的绩效层次结构:初始预测准确性和利用正确预测的能力是主要驱动因素,而研究量显示与结果没有相关性。并行的 Polymarket 实时交易出现了惊人的跨平台对比:Cohort 1 模型在 Polymarket 上的平均得分仅为 -1.1%,而在 Kalshi 上为 -22.6%,而 grok-4-20-checkpoint 的结算胜率达到 71.4%,是所有平台或同类组中最高的。 gemini-3.1-pro-preview(群组 2)在 Kalshi 上执行了零交易,三天内在 Polymarket 上实现了 +6.02%,这是任一群组中所有模型的最佳回报,这表明平台设计对模型的成功具有深远的影响。除了性能之外,我们还分析计算效率(词元使用、周期时间)、结算准确性、退出模式和市场偏好,从而全面了解前沿模型在实际财务压力下的表现。