论文
AIDABench:AI数据分析基准
AIDABench: AI Data Analytics Benchmark
摘要
随着AI驱动的文档理解与处理工具在真实应用中日益普及,对严格评估标准的需求愈发迫切。现有基准与评估往往聚焦孤立能力或简化场景,未能捕捉实际所需的端到端任务效能。为弥补这一空白,我们提出AIDABench,一个以端到端方式评估AI系统执行复杂数据分析任务的综合基准。AIDABench涵盖600多个跨三个核心能力维度(问答、数据可视化和文件生成)的多样化文档分析任务。这些任务立足于涉及电子表格、数据库、财务报告和运营记录等异构数据类型的真实场景,反映跨行业与跨职能的分析需求。值得注意的是,AIDABench中的任务难度颇高,即便是人类专家在AI工具辅助下每个问题也需要1-2小时,凸显了该基准的难度与真实世界复杂性。我们在AIDABench上评估了11个最先进模型,涵盖专有(如Claude Sonnet 4.5、Gemini 3 Pro Preview)与开源(如Qwen3-Max-2026-01-23-Thinking)家族。我们的结果显示,复杂的真实世界数据分析任务对当前AI系统仍是重大挑战,表现最好的模型pass@1仅达59.43%。我们对各能力维度的失败模式进行了细致分析,并指明未来研究的关键挑战。AIDABench为企业采购、工具选型和模型优化提供了有原则的参考,并已在 https://github.com/MichaelYang-lyx/AIDABench 公开。
