论文
用于预测市场解决方案的多智能体人工智能预言机系统的设计和评估
Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution
摘要
预测市场聚集集体智慧来预测不确定事件,但其效用取决于可靠的结果解决方案。现有的预言机系统需要在快速但脆弱的自动化与准确但成本高昂的人工仲裁之间进行权衡。单 LLM 预言机实现了有意义的准确性,但继承了其底层模型的所有故障模式,没有自我纠正机制。我们评估多代理 LLM 架构是否可以比单模型基线提高预言机解析精度。我们将独立聚合和协商共识与单个 LLM 基线(GPT-5 Nano、DeepSeek V3 和 Llama-3.3-70B)进行比较,涉及来自 KalshiBench 的 1,189 个已解决的预测市场问题。所有代理通过 Exa 共享一个共同的证据层,检索按发布日期进行过滤,以将推理与检索质量隔离开来。采用置信度加权投票的独立聚合实现了最高准确率 83.43%,比最佳个体模型高出 1.01 个百分点。深思熟虑的共识将准确率降低到大约 76%,低于每个单一模型的基线,这归因于辩论期间错误的传播,其中错误的模型自信地翻转了正确的模型。模型之间的误差相关性 (0.529-0.689) 解释了为什么聚合增益低于理论孔多塞上限,从而对集成方法造成了根本限制。许多问题都无法通过任何多代理架构进行纠正,从而导致升级为人工仲裁。我们提出了混合人工智能-人类预言系统的路由标准:仅自动解决一致的、高置信度的问题,在 47% 的数据集上产生 97.87% 的准确率,而代理间的分歧则标记其余部分供人工审查。