论文
FinSkillBench技能溢价分解
Knowledge or Calculator? Decomposing the Skill Premium in Verifiable Financial Agent Workflows
摘要
金融AI智能体要做的不仅是检索事实:投资工作流要求正确的定量执行、程序化资源的可靠使用以及可审计的结构化输出。我们提出FinSkillBench,一个覆盖投资组合构建、风险管理与基本面分析12个子任务的2603个时点episodes评测套件,配备隐藏可再生真值与任务特定的确定性验证器。跨9个模型、3种资源条件执行17820个episodes,8个模型的配对分析显示:精选技能包把平均分提高+16.2(0.366到0.528),而单episode内生成的技能只加+0.5且消耗更多token与轮次。我们进而通过分别授予人工撰写的程序化文档与可执行领域工具来分解精选溢价:文档单独+5.6,工具单独+19.5,两者组合次可加。溢价高度依赖工作流:可执行工具在数值密集型工作流中占主导,文档在程序或输出模式指引是瓶颈时更重要,解释型任务两者兼需。效应在10个评分变体与聚类bootstrap分析下符号稳定;独立实现的第二Harness复现方向性模式,同时显示效应大小取决于工具与数据的暴露方式。总体上,测得的"技能溢价"是模型、资源与Harness全系统的属性而非底层模型单独的属性。