论文

InvestPhilBench:评估LLM在专家投资哲学中程序性推理的多层基准

InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

模型评测基准与评测资源

摘要

大语言模型日益被部署为投资研究助理——但尚无基准测试它们能否准确重构并应用专家投资者的特定程序性决策框架。我们介绍InvestPhilBench——横跨八个认知层级的多层基准——从原则识别(L1)到新框架外推(L8)。v0.6版本含118张经一手来源验证的原则卡、25张带显式拓扑元数据的决策框架卡与243道问答(197开发/46留出测试)。为可复现的大规模评分——我们介绍基准自动评分管线(BASP)、五项算法指标、覆盖六种失败模式的失败模式检测协议(FMDP)——以及门重建准确率(GRA)——针对带金推理程序问题的逐门指标。本版本主要是基准与方法学贡献:其实证研究——188题开发划分(闭卷)的四模型健全性波次——刻意保持初步并压力测试指标设计而非排名模型。该波次显示尖锐的提供商层级分裂(BASP 0.906对0.438)——尽管这些混合裁判数字是受混淆的上界。中心方法学发现在此告警下仍然成立:BASP复合分在前沿饱和(Claude L4=0.932)——而GRA仍暴露程序性缺口(前沿L4 GRA约0.77、L7 GRA 0.57-0.62)——复合评分奖励流畅文笔并掩盖程序性差距。在100题专家标注金集上——自动BASP复合分以Pearson r=0.72(MAE=0.10)追踪人类参照。v0.6还实现统一裁判与真实模型在环检索/神谕条件;去混淆多模型排行榜与完整三条件运行为v1.0交付物。

InvestPhilBench:评估LLM在专家投资哲学中程序性推理的多层基准:论文配图
图 3:基准构建和评估流程(示意图)。五个阶段:主要来源(9名投资者,167万字)→知识库(118张原则卡+25个带有拓扑元数据的框架)→QA基准(243个问题,L1-L8,具有L4/L7的黄金推理程序)→评估(4个W1模型,缩放至10;三个条件;BASP + GRA)→诊断(提供商层分割;复合饱和与门级GRA差距;FMDP×6失败模式)。