论文

Crypto会计基准:评估前沿与开源语言模型在加密资产会计任务中的表现

Crypto Accounting Bench: Evaluating Frontier and Open-Weight Models on Crypto-Asset Accounting Tasks

模型评测基准与评测资源

摘要

我们提出了Crypto会计基准(CAB),用于评估前沿和开源语言模型是否能重构组织实际提交的加密资产交易完整会计分录。CAB包含来自7家匿名组织的118个评估任务,每个任务融合了交易机制、资产数量和基础货币价值、钱包及法律实体背景、交易对手证据、相关交易腿、重复性、税务持仓证据以及组织完整的会计科目表。目标是生成一个平衡的结构化分录,包含所有必需的账户、借贷方向、金额、货币及完整精度的资产数量。我们对12个模型进行评估,涵盖专有前沿系统和开源版本,每项任务进行3次独立尝试,共生成4,248条轨迹。报告三个指标:平均得分、Best@3和Pass@3。Pass@3指至少有一次尝试满足所有评分标准和关键判断门限的任务比例。表现最佳的模型达到77.43%的平均得分,最佳Pass@3为56.78%。基于每次任务最佳尝试的确定性诊断,对12个模型进行宏观平均显示,基础金额匹配度(97.8%)显著高于账户选择准确率(56.3%)。结合失败分析,结果表明账户选择和完整分录构成仍是CAB上的主要挑战。