论文
信用卡、混乱、计算和后果:关于语言模型推理我们能发现什么?
Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?
摘要
我们推出 CreditCardQA,这是第一个源自真实信用卡协议的数字推理金融素养基准。该数据集包含 1,800 个问题,包括反映消费者如何自然询问费用、利息和付款的第一人称变体。我们在思维链(CoT)和思维程序(PoT)提示下评估一系列大型语言和推理模型。总体而言,PoT 产生了一致的性能提升,特别是对于基线推理较弱的模型,并缩小了开源系统和闭源系统之间的差距。通过错误分析,我们表明失败较少是由算术引起的,而更多是由误用财务规则、遗漏条件和对合同条款的误解引起的。我们进一步分析问题难度,发现比较、条件逻辑和货币约束尤其具有挑战性。我们还发现,错误经常出现在边缘情况下,例如滞纳金或小额余额情况,这些情况更有可能影响低收入或经济脆弱的个人。