论文
BENCHCOMPASS:把支付领域大模型分数转为训练与Harness决策信号
BENCHCOMPASS: From Scores to Signals for Training and Harness Decisions in Payment-Domain LLMs
摘要
支付运营是关键金融基础设施,但大语言模型在该领域的价值仍不明确,因为规则变化快、证据分散,决策依赖交易状态、参与者角色、地区和支付通道。现有基准无法区分失效来自支付规则知识缺失、不会使用所给证据,还是面对不完美Harness输入时脆弱。我们提出支付领域基准BENCHCOMPASS,其构建流水线从类型化证据包生成场景任务,执行基于大模型的质量检查,创建任务输入攻击变体,最终条目准入由领域专家决定。发布内容包括经专家审查的Pro基准,覆盖支付知识、基于上下文的场景推理及Attacked Open鲁棒性;另有保障较低的Normal池供检查和未来整理。在16种模型变体上,基准揭示性质不同的失效:参数化支付知识缺失、对给定规则推理不完整、不能拒绝可信但无效的工作流。基准尚未饱和:最佳前沿模型在开放上下文依据推理上达到89.6%,攻击输入下81.7%;一个代表性的32B开放权重模型分别为69.8%和42.6%。数据与代码通过原摘要链接公开。
