论文
FinAutoRubric:用于评估金融研究Agent的专家指导自动生成评分标准
FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents
摘要
评估金融研究机构需要反映专家标准的评价标准,并在信息截止时确定正确的值。经过专家审查的金融基准依赖于固定的、按项目分类的标准,扩展这些标准的成本很高,而且无法编码每个机构自己的标准。在 FinAutoRubric 中,专家指定可重用的评估指南,而Agent和代码则执行特定于查询的评估准则生成、审查和验证。该专家指导作为代码强制执行的提示和规则来管理每个Agent,并且可重用标准的任务库将其跨任务携带。在遵循专家指导的长时域循环中,作家Agent研究每个预期值,审阅Agent验证它,并将失败升级给人类。在三个专家编写的金融基准上,其评分标准与最强的评估生成器一样密切跟踪专家评分,同时说明专家评分标准对更多标准的预期价值,其分数与人类评分一致,内部分析师更喜欢在盲审中使用它们。已发布的包含 100 个查询的 FinAutoRubric 基准由内部分析师针对 78 项任务和 8 个资产类别的关键问题构建而成,显示早期模型生成的评估准则仍为后续模型留有空间。