论文

弥合算术差距:面向稳健金融推理的认知复杂度基准与Financial-PoT

Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning

模型推理AI 基础设施推理策略与问题分解SandboxAgent Sandbox

摘要

虽然大语言模型擅长语义任务,但它们在金融定量推理上面临关键瓶颈,经常出现“算术幻觉”和我们称为“认知崩溃”的系统性失效模式。为严格量化这一现象,我们提出认知复杂度基准(CCB),一个基于95份真实中国A股年报构建数据集的稳健评估框架。与传统数据集不同,CCB将金融查询分层为三维分类:数据来源、映射难度和结果单位,从而能够精确诊断高认知负荷场景下的推理退化。为解决这些失效,我们提出迭代双阶段Financial-PoT框架。这一神经符号架构强制严格的架构解耦:首先隔离语义变量抽取和逻辑形式化,然后将计算卸载到迭代、自我纠错的Python沙箱以确保确定性执行。CCB上的评估表明,虽然标准思维链在复杂任务上表现挣扎,我们的方法提供了卓越的鲁棒性,将Qwen3-235B模型的平均准确率从59.7%提升到67.3%,在高复杂度推理任务上取得最高10倍的增益。这些发现表明,架构解耦是提升金融推理任务可靠性的关键使能因素,为需要语义理解与定量计算紧密对齐的精度关键领域提供了可迁移的架构洞见。