论文
更好的套牌还是不同的裁判?评估 Agentic 利用企业和投资银行业务的收益
Better Deck or Different Judge? Evaluating Agentic Harness Gains in Corporate and Investment Banking
摘要
企业和投资银行团队使用演示来支持信贷决策并为客户提供融资和交易方面的建议。制作这些套牌需要协调财务数据、追踪来源并将分析转化为建议。我们回顾性地研究了结合 27B 语言模型、财务计算、叙述模板和验证检查的 Agentic 工具的开发。大语言模型评委指导工程变更并评估由此产生的牌组,提出更高的分数是否反映更好的文件或评分变化的问题。在删除了模板标记的共享会话纯文本评分中,五名评委对整个系统的评分为 20.4 至 33.6 分(满分 95 分),高于直接从简短提示生成的同一模型。每位评委在所有 17 个开发成果上都给系统打了更高的分数。短提示范围内直接 Opus 生成的利润范围为 -4.7 至 +0.8 点。评委们对各个开发轮次取得的广泛进展达成一致,但对最终牌组排名的认同程度低于对汇总分数的认同程度。重复评分也会改变未改变的牌组上的分数,使得小的改进很难与判断的可变性区分开来。