论文

监督式金融NLP中的测量风险:JF-ICR上的评分细则与指标敏感性

Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR

模型评测评测方法与指标

摘要

随着LLM成为业绩电话会、投资者关系问答、业绩指引与信息披露语言的可信阅读者,监督式金融NLP基准日益充当模型选择与部署的决策证据。一个隐含假设是黄金标注使这类证据客观。当基准这把尺子本身对评分细则措辞、指标选择或聚合策略敏感时,该假设即告失效。我们在Japanese Financial Implicit-Commitment Recognition(JF-ICR;固定的253项测试集 x 4个前沿LLM x 5套评分细则 x 3种温度 x 5个序数指标)上研究这种测量风险。得出三点发现。第一,评分细则措辞实质性地改变模型给出的标签:R2-R3一致性在70.0%至83.4%之间,主要变动集中在+1 / 0隐含承诺边界附近。这一模式与语用边界解释相符,但并非经过验证的语言因果性论断,因为当前的细则变体将语义、示例与冗长度混杂在一起。第二,在JF-ICR的类别分布下,并非每个指标都保持信息量。within-one准确率过于宽松,因为近似失误也得分且多数类占主导;worst-class准确率噪声过大,因为最稀有类只有两个样本。因此,在我们的操作规则下,Exact accuracy、macro-F1与加权kappa是可识别的指标。第三,只有经过这种指标可识别性审计之后,排名结论才更站得住脚:Bradley-Terry、Borda与Ranked Pairs在可识别指标子集上结论一致,而完整的五指标扫描在最接近的一对模型上产生分歧。其贡献不是一份新排行榜,而是一种针对监督式金融基准的报告规范——这类基准虽有黄金标注,但其评估之尺仍需治理。