论文

ValueAlpha:在可观察回报之前对大语言模型判断的投资理由进行协议门控压力测试

ValueAlpha: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

模型评测评测方法与指标

摘要

长期投资决策会产生预实现评估问题:已实现的回报是投资质量的最终仲裁者,但它们来得太晚且噪音太大,无法指导许多模型开发和治理决策。大语言模型法官为人工智能金融系统的部署前评估提供了一个诱人的替代方案,但未经验证的法官可能会奖励冗长、自信或标题模仿,而不是财务判断。本文介绍了 \textbf{ValueAlpha},这是一种预先注册的协议门控压力测试协议,用于确定大语言模型判断的投资理由声明何时可发布、合格或无效。在一个受控的市场国家资本分配原型中,有 1,000 个诚实决策周期和 100 个预先注册的对抗性控制(1,100 个轨迹,5,500 个判断调用),ValueAlpha 在 \(\bar{\kappa}_w = 0.7168\) 处清除了聚合协议门,但防止了一些过度声明。较低排名的系统崩溃为平局类,一个标题维度未能通过每维度门(\texttt{constraint\_awareness},\(\bar{\kappa}_w = 0.2022\)),单评判排名取决于家庭,简洁正确的理由相对于诚实的理由会受到 \(\Delta = -2.81\) 标题点惩罚。有针对性的锚特异性探测进一步表明,诸如约束意识之类的财务结构在操作上是承重的。因此,该贡献不是排行榜,也不是衡量真实投资技能的主张。 ValueAlpha 是用于人工智能金融评估的预校准计量层:它确定提议的基于大语言模型法官的投资理由主张是否足够稳定、足够一致以及是否不受污染,足以被报告。