论文
InvestPhilBench:评估LLM在专家投资哲学中程序性推理的多层基准
InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy
摘要
大语言模型日益被部署为投资研究助理——但尚无基准测试它们能否准确重构并应用专家投资者的特定程序性决策框架。我们介绍InvestPhilBench——横跨八个认知层级的多层基准——从原则识别(L1)到新框架外推(L8)。v0.6版本含118张经一手来源验证的原则卡、25张带显式拓扑元数据的决策框架卡与243道问答(197开发/46留出测试)。为可复现的大规模评分——我们介绍基准自动评分管线(BASP)、五项算法指标、覆盖六种失败模式的失败模式检测协议(FMDP)——以及门重建准确率(GRA)——针对带金推理程序问题的逐门指标。本版本主要是基准与方法学贡献:其实证研究——188题开发划分(闭卷)的四模型健全性波次——刻意保持初步并压力测试指标设计而非排名模型。该波次显示尖锐的提供商层级分裂(BASP 0.906对0.438)——尽管这些混合裁判数字是受混淆的上界。中心方法学发现在此告警下仍然成立:BASP复合分在前沿饱和(Claude L4=0.932)——而GRA仍暴露程序性缺口(前沿L4 GRA约0.77、L7 GRA 0.57-0.62)——复合评分奖励流畅文笔并掩盖程序性差距。在100题专家标注金集上——自动BASP复合分以Pearson r=0.72(MAE=0.10)追踪人类参照。v0.6还实现统一裁判与真实模型在环检索/神谕条件;去混淆多模型排行榜与完整三条件运行为v1.0交付物。
