论文

用于多语言财务 QA 的语言路由 RAG 和直接选项评分:FinMMEval 的 DS@GT

Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval

上下文与知识检索增强

摘要

我们展示 DS@GT 向 FinMMEval 2026 任务 1 提交的内容,这是一项涵盖英语、西班牙语、希腊语、中文和印地语的多语言金融考试问答基准。 CFA、EFPA 和 CPA 等金融认证考试需要标准 NLP 基准无法捕获的结构化领域推理,而在检索和表示基础设施不发达的语言中,这一挑战更加复杂。我们在 LangGraph 上构建了一个检索增强管道,用于检测查询语言并使用 BGE-M3 嵌入和 FAISS 索引从包含 30,209 个条目的多语言知识库中检索语义相关的示例。然后,系统通过检索增强直接评分 (RADS) 对答案进行评分,读取候选选项字母上的下一个标记对数概率,而不是生成自由格式的输出。对于资源匮乏的语言,我们使用加权倒数排名融合来融合每种语言和跨语言检索索引。模型选择按语言进行:Qwen3-14B 适用于阿拉伯语、中文和印地语; Qwen2.5-14B 英语;以及希腊语的 Llama-3.1-8B,这是一种源自经验消融的路由,揭示了巨大的语言不对称性能差距。值得注意的是,思维链提示会显着降低希腊语的准确性(90.7% 至 20.9%),而启用 Qwen3 的默认思维模式会使阿拉伯语 RADS 的性能崩溃到近乎偶然的水平。我们的结果表明,有效的多语言金融推理需要语言感知检索、模型路由和深思熟虑的评分策略选择。