论文

TaxPraBen:中国现实税务实践中 LLM 结构化评估的可扩展基准

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

模型评测基准与评测资源

摘要

虽然大语言模型 (LLM)在各个一般领域表现出色,但它们在高度专业化、知识密集型和受法律监管的中国税务领域表现出显着差距。因此,虽然与税收相关的基准越来越受到关注,但许多基准都专注于孤立的 NLP 任务,而忽视了现实世界的实际能力。为了解决这个问题,我们推出了TaxPraBen,这是第一个针对中国税务实践的专用基准。它结合了 10 个传统应用任务以及 3 个开创性的现实场景:税务风险防范、税务检查分析和税务策略规划,源自 14 个数据集,总计 7300 个实例。 TaxPraBen具有可扩展的结构化评估范式,通过“结构化解析-字段对齐提取-数字和文本匹配”过程设计,实现端到端税务实践评估,同时可扩展到其他领域。我们根据 Bloom 分类法评估 19 LLM。结果表明,性能存在显着差异:所有闭源大参数 LLM 都表现出色,而像 Qwen2.5 这样的中文 LLM 普遍超过多语言 LLM,而 YaYi2 LLM 在使用一些税务数据进行微调后,仅显示出有限的改进。 TaxPraBen 是在实际应用中推进 LLM 评估的重要资源。