论文

StakeBench:评估基于市场承诺的语言理解

StakeBench: Evaluating Language Understanding Grounded in Market Commitment

模型评测基准与评测资源

摘要

现有的金融 NLP 基准通常依赖于外部观察者提供的标签,衡量语言的感知方式,而不是说话者在市场上的承诺。我们推出 StakeBench,这是一个基于市场承诺的语言理解评估框架。 StakeBench 将来自 2,261 个已解决市场的 560,876 条评论与 Polymarket 和 Manifold 中经过验证的头寸、行动和市场赔率记录联系起来。监管源于可观察的市场行为。持仓方、评论后交易行为和市场赔率轨迹取代了人工注释。四个诊断任务测试模型是否检测市场承诺、识别显露的一面、预测未来行动以及执行集体赔率预测。三个承诺感知指标衡量与显示的偏好而不是感知情绪的一致性。有效性审核和明确的解释边界有助于区分可观察的承诺信号与潜在信念和因果市场赔率影响。在 15 个 LLM 和 18 个主题和平台设置中,模型部分恢复了位置侧信号,定向精度从 0.506 到 0.599,但在后续任务中显示出结构性故障。十五个模型中的十个在未来行动预期中崩溃为一两个行动标签,并且没有一个模型能够持续改进集体赔率预测中的朴素赔率方向基线。模型规模与性能不相关,金融领域调整并不能改善揭示方识别,平台激励强烈塑造高阶结果。 StakeBench 在 CC-BY 4.0 下打包了评估代码和数据集。