论文

同值引文互换:压力测试 Jev 财务证据判断

Same-Number Citation Swaps: Stress-Testing Jev as a Financial Evidence Judge

模型推理推理验证与自校正

摘要

财务报告跨期间、指标和会计科目重复值,允许 LLM 生成的计算在数字上正确,但引用了错误的财务角色。我们使用 Jev 作为 GPT-4.1-mini 计算轨迹的源支持验证器来评估验证在数字匹配之外添加的概率证据。指针上有符号数字基线解释了精确报价检查的大部分恢复。为了隔离剩余的角色识别问题,我们固定操作数和算术,在相同编号的单元格之间移动引用,并保留表达等效事实的控件。这些对比揭示了通过的错误角色引用和被保留的有效替代引用。明确的列标签可以改善选定的错误角色决策,同时也降低对某些等效证据的支持。由非作者审稿人标记的 36 个新源页面的后续构建扩展了这种评估,并揭示了检测角色错误和保留有效引用之间的相同权衡。该贡献是一种受控评估,可识别概率财务验证者在数字匹配保持固定时区分的内容。对于基于 LLM 的财务助理,它可以单独评估数值正确性、引用角色支持和接受结果。