论文
FinProBench:用专业交付物构建角色评分量规以评估金融AI Agent
FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
摘要
评估金融AI Agent需要与实际专业工作一致的标准。现有评分量规通常从任务提示或模型输出推导标准,忽视了只有专业人员交付物中才体现的隐性要求。作者提出金融专业任务基准FinProBench和可复用的角色支撑评分量规构建流程RGRC,从同一岗位的专业人员交付物提取标准。流程分为交付物收集、能力提取、量规合成和验证四阶段,能够捕捉隐性标准、区分质量水平,并在同一岗位内跨任务使用。分析前,按交付物类别将57个职业划为30个模型先验丰富的常规角色和27个先验稀疏的专业角色。常规角色中,仅用提示的方法接近RGRC(89.2%对90.7%);专业角色中,RGRC显著优于仅用提示(99.1%对78.0%)。这表明,当工作规范已充分体现于模型先验中,提示工程可近似构造量规;超出先验的标准则需要专业交付物提供依据。FinProBench整理了1,723份交付物,覆盖57个职业、8个金融子行业和161种交付物类型;首批公开评估集含20项完整任务,覆盖7个子行业的20种角色。在不同LLM评审模型和角色级量规下,人类交付物平均分最高,满分100分时分别为73.7、70.3、70.2和69.6;但四个系统的95%置信区间重叠,且各有互补优势。相较每次从零编写量规,按角色复用量规使估算的单任务构建工作量降低6.7倍。
