论文

CIFQA:面向金融问答的确定性工具锚定多智能体LLM框架

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

摘要

计算密集型金融问答需要对结构化利率、时间条件、数值公式和基于规则的约束进行精确推理。尽管大语言模型(LLM)在自然语言任务上表现强劲,但在求解多步金融计算时,它们常常给出数值错误却貌似合理的答案。针对这一局限,我们提出CIFQA(Calculation-Intensive Financial Query Answering),一个面向金融问答的确定性工具锚定多智能体LLM框架。CIFQA将语言理解与数值执行分离:由专门的智能体负责查询解读、路由、参数抽取、计算规划和响应生成,而确定性的基于Python的工具执行金融计算和规则应用。我们将CIFQA实例化用于固定存款问答,并在一个精选的固定存款查询基准上评估。CIFQA在计算密集型查询上达到95.54%的准确率,总体准确率为90.87%,大幅优于即使提供完整公式、利率表和基准指令的直接LLM基线。消融研究显示,精确利率查找、期限计算、滚动年度调整和提前支取逻辑等确定性组件是性能的关键贡献因素。值得注意的是,在CIFQA框架内运行的17B开源骨干模型优于在相同金融信息下评估的规模大得多的前沿模型,这表明架构设计是数值可靠性的更重要决定因素,而非模型规模。虽然是在固定存款查询上评估,CIFQA为计算密集型金融推理任务提供了一个可泛化的框架。

CIFQA:面向金融问答的确定性工具锚定多智能体LLM框架:论文配图
图1:尽管公式、利率表和基准说明齐备,前沿 LLM 在计算密集型定期存款查询上的代表性执行失败。