论文

FinToolBench:面向真实世界金融工具使用的LLM智能体评测

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

智能体系统Agent任务评测

摘要

大语言模型(LLM)与金融领域的融合正推动一场从被动信息检索到动态智能体交互的范式转变。尽管通用工具学习的基准测试激增,但以高风险、严格合规和快速数据波动为特征的金融行业仍然严重缺乏相应评测。现有金融评测主要聚焦于静态文本分析或基于文档的问答,忽视了工具执行的复杂现实。相反,通用工具基准缺乏金融所需的领域特定严谨性,往往依赖玩具环境或数量微不足道的金融API。为弥合这一差距,我们提出FinToolBench,这是首个致力于评测金融工具学习智能体的真实世界可运行基准。与以往仅限于少量模拟工具的工作不同,FinToolBench构建了一个将760个可执行金融工具与295条严格且必须调用工具的查询相耦合的真实生态系统。我们提出一种超越二元执行成功与否的新型评测框架,从金融关键维度评估智能体:时效性、意图类型和监管领域对齐。此外,我们提出FATR,一个金融感知的工具检索与推理基线,可增强稳定性与合规性。通过提供首个可审计的智能体金融执行测试平台,FinToolBench为可信金融AI树立了新标准。工具清单、执行环境与评测代码将开源,以促进未来研究。

FinToolBench:面向真实世界金融工具使用的LLM智能体评测:论文配图
图 1.FinToolBench 概述。左:我们跨代表性类别的基准范围。右:标准化执行管道的示例,其中 LLM 代理选择工具,观察环境输出,并通过可审核的工具跟踪生成最终答案。FinToolBench 概览图显示了按类别划分的 760 个工具以及从用户查询到工具调用、环境观察和最终答案的示例工具执行管道。