论文

FinTrace:面向长程金融任务的LLM工具调用轨迹级整体评测

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

智能体系统Agent任务评测长程任务评测

摘要

近期研究表明,工具调用能力使大语言模型(LLM)能够与外部环境交互以完成长程金融任务。尽管已有基准开始评测金融工具调用,但它们聚焦于有限场景,并依赖无法捕捉轨迹级推理质量的调用级指标。为填补这一空白,我们提出FinTrace,一个由800条专家标注轨迹组成的基准,覆盖34个真实金融任务类别和多个难度级别。FinTrace采用基于评分细则的评测协议,沿四个轴——行动正确性、执行效率、过程质量与输出质量——组织九项指标,从而对LLM工具调用行为进行细粒度评估。我们对13个LLM的评测显示,尽管前沿模型在工具选择上表现出色,所有模型都在信息利用与最终答案质量上表现挣扎,暴露出'调用正确的工具'与'对其输出进行有效推理'之间的关键鸿沟。为超越诊断,我们构建了FinTrace-Training,首个面向金融工具调用的轨迹级偏好数据集,包含8,196条精选轨迹,配有工具增强的上下文与偏好对。我们先用监督微调再以直接偏好优化(DPO)微调Qwen-3-8B/32B,结果显示在FinTrace-Training上的训练持续改进中间推理指标,其中DPO更有效地抑制失败模式。然而,端到端答案质量仍是瓶颈,表明轨迹层面的改进尚未完全传导到最终输出质量。

FinTrace:面向长程金融任务的LLM工具调用轨迹级整体评测
图 1:FinTrace 基准构建流程。