论文
FinInteract:模糊金融问答中的澄清与意图整合基准
FinInteract: Benchmarking Clarification and Intent Integration in Ambiguous Financial Question Answering
摘要
大语言模型智能体越来越多地通过检索监管申报文件来回答金融问题。这类问题常常隐性欠规范:Meta Platforms 的“营业收入”在合并口径下是 467.5 亿美元,而 Family of Apps 分部为 628.7 亿美元,每种读法都能在申报文件中得到确切验证。有能力的智能体应识别歧义并追问,而不是径自选定一个貌似合理但非用户本意的读法。现有金融基准无法测量这一点:每题一个金标准答案无法区分“解决了歧义的智能体”与“猜了常见读法的智能体”,我们称这一盲区为单金标准幻觉。我们发布 FinInteract,一个双语(英文/中文)基准,包含 173 个实例,每题配一个默认解读和一个意图解读,覆盖五类歧义分类,并评估智能体能否引出正确的澄清并随后将其整合。若按默认解读而非意图解读对相同输出重新评分,GPT-4o 的准确率被夸大 3.1 倍,印证了这一幻觉。此外我们发现:给定解读后模型答题超过 90%,但需要自己引出解读时最高只有 28.9%;分类体系对实体范围和指标定义两类充分有效,对其他类别属探索性;以歧义类别为条件在推理和训练时都能提升歧义消解。
