论文

阅读不是使用:检索、判断与AI金融研究流程设计

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地被部署为人工智能分析师,以处理财务披露并支持人工智能辅助的投资决策。然而,评估此类系统的标准通常是它们能够检索到的内容,而不是检索到的信息是否会影响它们的判断。我们发现长上下文财务分析中存在检索整合差距。保持焦点公司信息固定,仅改变 2,000 到 128,000 个词元的不相关上下文,我们发现即使直接检索仍然准确,风险披露对投资判断的影响也会落入实验噪声层。该模式在模型系列和判断任务中重复,并在实验中从实际的 10-K 申请中消除了真实的披露。功能更强大的模型会推迟但不会消除差距。因果记忆干预表明,压缩摘要和源文本查找共同将披露转化为判断。工作流架构决定了这种传输是否成功:分块和汇总管道驱逐相关信息,而与决策相邻的有针对性的结构化重述则恢复其影响。因此,人工智能分析师的表现是由模型能力和工作流程架构共同决定的。基于检索的评估可以证明其投资判断忽略了它们明显检索到的信息的系统。