论文

FinancialAuditBench:用差分隐私先验构建Agent财务审计任务

FinancialAuditBench: Benchmark Construction under Differential Privacy Using Real-World Priors

智能体系统Agent任务评测

摘要

随着人工智能Agent在金融服务行业中得到广泛采用,仔细的测量对于了解它们可以可靠地部署在哪里以及在哪里仍然需要监督和专业审查至关重要。然而,这种测量受到对专有或隐私敏感数据的有限访问的限制。因此,现有基准通常依赖于公开数据、人工和/或LLM创作的任务或简化的设置。我们引入了 FinancialAuditBench,这是评估Agent财务报表审计任务的基准,以及系统生成综合业务的框架。我们的任务生成框架利用历史审计中的差异化私有汇总统计数据以及通过 1,100 多个小时的基准开发和审查提供的审计专业知识。 FinancialAuditBench 包含 90 项任务,涵盖工作底稿的完成和六个综合审计业务的审查,每个任务平均包含 179 个文件。对十一个前沿模型的评估表明,虽然Agent很好地完成了员工级别审计任务的大部分,但他们有时会执行不适当的程序或生成不正确的文档。除了财务审计之外,我们的框架还提供了一种系统生成合成任务的方法,用于隐私敏感领域的模型评估和训练。