论文

FinSkillBench:面向投资管理的AI智能体与领域技能评估

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

智能体系统Agent任务评测Agent Skills

摘要

投资管理是一个高风险领域,智能体AI系统在其中必须做到的远不止生成看似合理的文本。它们必须检索时点数据、组装正确的计算输入、调用专门化方法,并产出可审计的结构化输出。我们提出FinSkillBench,这是一个评估套件,旨在衡量语言模型智能体能否有效运用金融领域技能来解决投资管理任务。该基准涵盖三个领域——投资组合构建、风险管理和基本面分析,包含12个子任务、2603个任务片段。每个片段提供时点输入、隐藏的真实答案和任务专属的验证器。我们比较三种条件:无技能、精选技能包(由程序性文档和可执行组件构成),以及自生成技能(智能体在一个片段内编写并复用自己的程序)。在9个模型和大规模评估中,精选技能持续提升性能,将平均分从0.366提高到0.528,其中投资组合构建和风险管理领域获益最大。相比之下,自生成技能尽管计算成本更高,却几乎没有带来收益。一项使用独立智能体框架(Hermes Agent,8个模型,总计5280个片段)的独立评估在全部三个领域上复现了这一方向性模式,技能效应的大小因子任务和评估框架而异。这些结果表明,在投资管理智能体中,获得可靠的程序性技能可能与模型选择同等重要,而朴素的技能自生成往往无效。我们发布该基准、评估工具、精选技能包和完整轨迹,以支持进一步研究。