论文

FinInteract:模糊金融问答中的澄清与意图整合基准

FinInteract: Benchmarking Clarification and Intent Integration in Ambiguous Financial Question Answering

智能体系统Agent任务评测

摘要

大语言模型智能体越来越多地通过检索监管申报文件来回答金融问题。这类问题常常隐性欠规范:Meta Platforms 的“营业收入”在合并口径下是 467.5 亿美元,而 Family of Apps 分部为 628.7 亿美元,每种读法都能在申报文件中得到确切验证。有能力的智能体应识别歧义并追问,而不是径自选定一个貌似合理但非用户本意的读法。现有金融基准无法测量这一点:每题一个金标准答案无法区分“解决了歧义的智能体”与“猜了常见读法的智能体”,我们称这一盲区为单金标准幻觉。我们发布 FinInteract,一个双语(英文/中文)基准,包含 173 个实例,每题配一个默认解读和一个意图解读,覆盖五类歧义分类,并评估智能体能否引出正确的澄清并随后将其整合。若按默认解读而非意图解读对相同输出重新评分,GPT-4o 的准确率被夸大 3.1 倍,印证了这一幻觉。此外我们发现:给定解读后模型答题超过 90%,但需要自己引出解读时最高只有 28.9%;分类体系对实体范围和指标定义两类充分有效,对其他类别属探索性;以歧义类别为条件在推理和训练时都能提升歧义消解。

FinInteract:模糊金融问答中的澄清与意图整合基准:论文配图
图 1:在歧义查询上评估金融智能体。(1-2) 一个真实查询(“Meta Platforms 的营业收入是多少?”)看似完全明确,却隐藏着五类歧义(实体、指标、期间、申报文件、会计政策),此处存在两个均可辩护的答案:默认的 628.7 亿美元(应用家族分部)与题设意图的 467.5 亿美元(合并 GAAP)。(3) 仅用搜索的智能体返回看似合理的默认值,而单一金标准基准会将其判为正确——这种“单一金标准错觉”会将能力高估至多 3 倍。(4) FinInteract 转而评判智能体是否主动询问:GPT-5 智能体在自由交互下仅达 20.2%,而歧义消解后可达 93-95%,说明差距在于交互而非知识缺失。