论文

大语言模型 审稿人可靠吗?财务文件中错误检测的基准

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

模型评测基准与评测资源

摘要

确保财务文件的准确性对于经济分析、监管合规和企业决策至关重要。多项研究表明,大语言模型 (LLM) 在许多财务任务中表现良好,例如股票价格变动和财务分析。然而,还有一个关键任务尚未探索:LLM 识别财务文档中错误的能力。在本文中,我们介绍了 \textbf{FinED-Bench},这是第一个公开的 \textbf{Bench} 标记,用于跨三个认知复杂度级别的 \textbf{Fin}ancial \textbf{E}rror \textbf{D} 检测。 FinED-Bench 涵盖了 9 个现实世界的金融场景,并包含 2025 年报告的 900 多个文档,这些文档是现有语言模型无法看到的。我们详细介绍了基准构建过程,并在此任务上评估了几个先进的 LLM(例如 GPT-4o、Qwen3-14B),这需要金融领域知识和推理能力。实验结果表明,当前的 LLM 仍然难以完成这项任务,特别是在高复杂性的情况下。此外,有监督的 微调 可以显着提高较弱的 LLM 在此任务上的性能。我们的数据和代码可在 https://github.com/hedyHe/FinED-Bench 获取。