论文
开放权重模型能在金融文本理解上与专有模型竞争吗?
Can Open-Weight Models Compete on Financial Text Comprehension?
摘要
近几个月,中国AI实验室的开放权重语言模型在基准上追赶上了专有前沿模型。但它们在真实金融任务上的可靠性仍未得到充分检验。我们更新了Financial Touchstone基准,现包含覆盖495份国际年报的2,967个“问题-上下文-答案”三元组。我们还将一组新模型应用于该基准,把覆盖范围从十家提供商的十一个模型扩展到二十个,包括GLM 4.7、GLM 5、Kimi K2.6和DeepSeek V3.2等近期开放权重模型,以及阿里巴巴的专有旗舰Qwen3-Max。Anthropic的Claude Opus 4.6取得最高准确率(88.4%),Google的Gemini 2.5 Pro保持最低幻觉率(0.08%)。值得注意的是,开放权重的Kimi K2.6在准确率上排名第三,非推理模型GLM 5和Mistral 3分列第四、第五,这挑战了推理架构或专有权重是强大金融理解前提的假设。信息检索仍是主要瓶颈,占全部失败的48.9%。我们还记录了一项新发现:中国模型的地缘政治内容过滤会拒绝合法的金融问题(占尝试的0.08%),有时没有明确原因,且拒绝行为既取决于模型也取决于访问渠道。完整数据集与评估框架已公开。
