IndiaFinBench:大语言模型 印度金融监管文本表现的评估基准
IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text
摘要
我们介绍 IndiaFinBench,据我们所知,这是第一个公开可用的评估基准,用于评估 大语言模型 (LLM) 在印度金融监管文本上的表现。现有的金融 NLP 基准完全来自西方金融语料库(SEC 文件、美国收益报告、英语金融新闻),在非西方监管框架的覆盖范围上留下了巨大的空白。 IndiaFinBench 提供了 406 个专家注释的问答对,这些问答对取自印度证券交易委员会 (SEBI) 和印度储备银行 (RBI) 的 192 份文件,涵盖四种任务类型:监管解释(174 项)、数字推理(92 项)、矛盾检测(62 项)和时间推理(78 项)。注释质量通过基于模型的二次传递(矛盾检测 kappa=0.918;150 项子集的总体一致性为 90.7%)和三轮注释中的 180 项人类注释者间一致性研究(矛盾检测 kappa=0.645;总体一致性 77.2%;基准覆盖率 44.3%)进行验证。我们在零样本条件下评估了 12 个模型,准确率范围从 70.4% (Gemma 4 E4B) 到 89.7% (Gemini 2.5 Flash)。所有模型的表现均显着优于非专业人类基线 69.0%。数值推理是最具歧视性的任务,不同模型之间的差距为 35.9 个百分点。 Bootstrap 显着性测试(10,000 次重新采样)揭示了三个统计上不同的性能层。数据集、评估代码和所有模型输出可在 https://github.com/rajveerpall/IndiaFinBench 获取