论文

FinProBench:用专业交付物构建角色评分量规以评估金融AI Agent

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

智能体系统Agent任务评测

摘要

评估金融AI Agent需要与实际专业工作一致的标准。现有评分量规通常从任务提示或模型输出推导标准,忽视了只有专业人员交付物中才体现的隐性要求。作者提出金融专业任务基准FinProBench和可复用的角色支撑评分量规构建流程RGRC,从同一岗位的专业人员交付物提取标准。流程分为交付物收集、能力提取、量规合成和验证四阶段,能够捕捉隐性标准、区分质量水平,并在同一岗位内跨任务使用。分析前,按交付物类别将57个职业划为30个模型先验丰富的常规角色和27个先验稀疏的专业角色。常规角色中,仅用提示的方法接近RGRC(89.2%对90.7%);专业角色中,RGRC显著优于仅用提示(99.1%对78.0%)。这表明,当工作规范已充分体现于模型先验中,提示工程可近似构造量规;超出先验的标准则需要专业交付物提供依据。FinProBench整理了1,723份交付物,覆盖57个职业、8个金融子行业和161种交付物类型;首批公开评估集含20项完整任务,覆盖7个子行业的20种角色。在不同LLM评审模型和角色级量规下,人类交付物平均分最高,满分100分时分别为73.7、70.3、70.2和69.6;但四个系统的95%置信区间重叠,且各有互补优势。相较每次从零编写量规,按角色复用量规使估算的单任务构建工作量降低6.7倍。

FinProBench:用专业交付物构建角色评分量规以评估金融AI Agent:论文配图
图 1:FinProBench 覆盖范围:1,723 个专业交付成果,涵盖 57 个角色、161 个交付成果类型和 8 个金融子行业;初始评估集包含跨 20 个角色和 7 个子行业的 20 项任务。