论文

APEX-会计

APEX-Accounting

模型评测基准与评测资源

摘要

我们引入 APEX-Accounting,这是 Mercor 与 Ramp 合作建立的基准,用于评估前沿模型是否可以完成会计师的实际工作。任务包括核对账户、应计费用、过帐交易和生成报告。私人评估集包含 160 个任务,分布在 10 个世界中。每个世界都包含一个会计系统以及电子表格、PDF 和其他文件。每项任务均由会计和簿记专家撰写和解决,他们还编写评分标准。在九个前沿模型中,Claude-Fable-5 (Max) 以 56.4% 的平均 Criteria@3 领先,领先于 Muse-Spark-1.1 (xHigh) 的 52.6%。没有模型得分超过 2.6% Pass^8 (GPT-5.6-Sol (Max+Pro)),最高 Pass@8 为 21.5% (Muse-Spark-1.1 (xHigh))。我们尝试将 词元预算 从 1 美元增加到 50 美元,并观察辛普森悖论的一个实例:分数随着 词元预算 的增加而增加,但在给定的预算约束范围内,模型花费更多词元的任务的分数较低。由于 APEX-Accounting 是一个封闭的基准测试,因此可以根据要求对任何前沿模型运行排行榜评估。